Skip to content

vllm_omni.model_executor.models.qwen3_tts

Modules:

Name Description
cached_code_predictor

Frame-local KV reuse for the Qwen3-TTS residual codebooks.

code_predictor_sampling

Top-k Gumbel sampling with the outer MTP graph's supplied uniforms.

configuration_qwen3_tts
cuda_graph_decoder_wrapper

CUDA Graph wrapper for Qwen3TTSTokenizerV2Decoder.

first_audio

Qwen3-TTS first-frame decode eligibility.

first_frame_decoder

First codec frame -> PCM inside the Talker process.

fused_code_predictor

Fused residual-codebook predictor for Qwen3-TTS (CUDA, BF16).

pipeline

Qwen3-TTS pipeline: Talker (text → RVQ codec) → Code2Wav (codec → audio).

prompt_embeds_builder

Stand-alone builder for Qwen3-TTS AR talker prompt embeddings.

qwen3_tts_code2wav
qwen3_tts_code_predictor_vllm

Qwen3-TTS predictor: per-call sampling and opt-in CUDA frame-local KV reuse.

qwen3_tts_talker
qwen3_tts_tokenizer
segmented_graph_wrapper

CUDA Graph wrapper for Qwen3TTSTokenizerV2Decoder.

stream_decode

Eligibility and model options for the single-stage CUDA PCM pipeline.

tokenizer_12hz
tokenizer_25hz