GPU Model Management
Control which models are loaded in GPU memory. Only one model type can be loaded at a time.
Qwen3-TTS Server (CPU Only)
VoiceDesign (1.7B)
Base Clone (1.7B)
LM Studio (LLM)
qwen/qwen3.5-9b
(qwen/qwen3.5-9b)
ctx=32512
Pipeline GPU Usage Guide
Pipeline Stage → GPU State:
📖 Analysis (BookNLP + LLM profiling) → LM Studio loaded, Qwen unloaded
🎭 Voice Design (generate voice refs) → Qwen VoiceDesign loaded, LM Studio unloaded
✂️ Segmentation (manifests) → Both unloaded
🔊 Generation (TTS synthesis) → Qwen Base loaded, LM Studio unloaded
📦 Export → Both unloaded
Manual controls above override automatic management.
Step 1 Complete
Manuscript Uploaded
35 chapters loaded
Keeps speakers, voices, and names. Re-runs analysis on the new manuscript text.
⚠ Archives all current data (speakers, voices, audio) for later reference. Starts fresh.
Step 2 Complete
Scan Results
File
DealHunterShip_4.0e_whole-to-audio.docx
Format
DOCX
Chapters
35
Scenes
51
Marker Tags
[book start] ✓
[author note] ✓
[toc] ✓
[chapter] ✓
[back matter] ✓
61 speakers found
94 voice references ready
4399 utterances across 35 chapters
Step 6: Generate Audiobook
Generate audio for all utterances using the assigned voices.
Step 7: Export Audiobook
Requires audio generation to complete. Exports to M4B and MP3.