main
official FunAudioLLM/CosyVoice repository and Fun-CosyVoice3 model package
COSYVOICE / STREAMING TOKEN + FLOW TTS / 2025

Fun-CosyVoice 3 · 0.5B

TOTAL0.5Bparameters
ACTIVE0.5Bruntime path
DEPTHLLM + Flowrepeated blocks
HIDDEN≈1,024main trunk
CONTEXTstreamingstream / sequence
CHECKPOINT≈2.0GB system4 shards · Apache-2.0
INTERACTIVE SYSTEM BLUEPRINT

MODEL MRI

Fun-CosyVoice 3 · 0.5B · Architecture Explorer

128 tokens → 10 seconds · 1.33T arithmetic FLOPs · click any module for evidence

VERIFIED ADAPTER
INPUT128TOKENS
TRANSFORMER STACKTOKEN LLM → FLOW → VOCODERdiscrete planning followed by continuous acoustic rendering
Three-Stage Residual
++
OUTPUT10SECONDS
wraps every repeated block
CAUSAL SPEECH-TOKEN LLM · TOKEN–FLOW CASCADE离散 LLM 与连续 Flow 分工,token 可边生成边交给声学模块。
Flow Acoustic Model连续生成阶段补足离散 token 没有携带的声学细节。
LLM≈0.5Bspeech tokens
FLOWconditionalacoustics
VOCODERneuralwaveform
MODEstreamingonline
VOICEzero-shotprompt
LICENSEApache-2.0code/weights