vllm_omni.model_executor.models.qwen3_tts ¶
Modules:
| Name | Description |
|---|---|
cached_code_predictor | Frame-local KV reuse for the Qwen3-TTS residual codebooks. |
code_predictor_sampling | Top-k Gumbel sampling with the outer MTP graph's supplied uniforms. |
configuration_qwen3_tts | |
cuda_graph_decoder_wrapper | CUDA Graph wrapper for Qwen3TTSTokenizerV2Decoder. |
first_audio | Qwen3-TTS first-frame decode eligibility. |
first_frame_decoder | First codec frame -> PCM inside the Talker process. |
fused_code_predictor | Fused residual-codebook predictor for Qwen3-TTS (CUDA, BF16). |
pipeline | Qwen3-TTS pipeline: Talker (text → RVQ codec) → Code2Wav (codec → audio). |
prompt_embeds_builder | Stand-alone builder for Qwen3-TTS AR talker prompt embeddings. |
qwen3_tts_code2wav | |
qwen3_tts_code_predictor_vllm | Qwen3-TTS predictor: per-call sampling and opt-in CUDA frame-local KV reuse. |
qwen3_tts_talker | |
qwen3_tts_tokenizer | |
segmented_graph_wrapper | CUDA Graph wrapper for Qwen3TTSTokenizerV2Decoder. |
stream_decode | Eligibility and model options for the single-stage CUDA PCM pipeline. |
tokenizer_12hz | |
tokenizer_25hz | |