main
official Qwen2.5-VL blog, model card and config
QWEN / NATIVE RESOLUTION VLM / 2025

Qwen2.5-VL-72B

TOTAL≈73Bparameters
ACTIVE≈73Bper token
DEPTH32 + 80repeated blocks
HIDDEN1,280→8,192main trunk
CONTEXT128Knative tokens
CHECKPOINT≈146GB38 shards · Qwen Research
INTERACTIVE SYSTEM BLUEPRINT

MODEL MRI

Qwen2.5-VL-72B · Architecture Explorer

100K INPUT + 1K OUTPUT · 28.12P arithmetic FLOPs · click any module for evidence

VERIFIED ADAPTER
INPUT100.0KIMAGE · VIDEO · TEXT
TRANSFORMER STACK32L VIT + 80L LLMwindow vision encoder → merger → Qwen2.5 decoder
Dual-Stack RMSNorm
++
OUTPUT1.0KTOKENS
wraps every repeated block
WINDOW + FULL VISION ATTENTION · M-ROPE + ABSOLUTE TIME图像坐标与视频时间直接进入位置编码,而不是只用一维 token 顺序。
Qwen2.5 72B Decoder视觉 token 与文本 token 合并后由 dense LLM 完成理解和结构化生成。
VISION32L1,280
FULL VIT4Lglobal
LANGUAGE80L8,192
MERGE2×2patches
CONTEXT128Ktokens
PARAMS≈73Bsystem