official Tencent-Hunyuan/HunyuanVideo repository, paper and configs
TENCENT / DUAL-TO-SINGLE VIDEO / 2024
HunyuanVideo · 13B
TOTAL≈13Bparameters
ACTIVE≈13B / stepper denoise step
DEPTH20 + 40repeated blocks
HIDDEN3,072main trunk
CONTEXT720P videolatent canvas
CHECKPOINT≈26GB4 shards · Tencent Hunyuan Community
INPUT704²VIDEO CANVAS
TRANSFORMER STACK20 DOUBLE + 40 SINGLEmodality-specific streams → unified video/text stream
Modulated Flow Residual
++
OUTPUT129FFRAMES
wraps every repeated block
FULL SPATIOTEMPORAL ATTENTION · DUAL-TO-SINGLE FUSION融合时机显式编码在深度结构中,而不是所有层都做相同操作。
13B Video Transformer视频生成主干在每个采样步处理完整时空 latent。
DOUBLE20Ltwo streams
SINGLE40Ljoint
HIDDEN3,072main
VAEcausal 3Dcodec
TARGET720Pvideo
PARAMS≈13Bcore