main
official Qwen3-TTS config + 1 model and 1 codec safetensors
QWEN / STREAMING TTS / 2026

Qwen3-TTS-12Hz-1.7B

TOTAL1.93Bparameters
ACTIVE1.93Bruntime path
DEPTH28 + 5repeated blocks
HIDDEN2,048main trunk
CONTEXT32Kstream / sequence
CHECKPOINT4.54GB2 shards · Apache-2.0
INTERACTIVE SYSTEM BLUEPRINT

MODEL MRI

Qwen3-TTS-12Hz-1.7B · Architecture Explorer

128 tokens → 10 seconds · 932.38G arithmetic FLOPs · click any module for evidence

VERIFIED ADAPTER
INPUT128TOKENS
TRANSFORMER STACK28 + 5 LAYERSTalker generates semantic stream · predictor fills codebooks
Dual-Track Residual
++
OUTPUT10SECONDS
wraps every repeated block
CAUSAL GQA · DUAL-TRACK STREAMING文本输入与音频输出分别推进,使尚未读完的文本与已生成音频可并行。
Code Predictor在主语义 token 后补齐多码本声学细节。
TALKER28L2,048
PREDICT5L1,024
CODE RATE12.5Hzaudio
GROUPS16codebooks
LATENCY≈97msfirst packet
PARAMS1.93Bheader