official Qwen3 repository + Qwen3-235B-A22B config/model card
QWEN / DENSE + MOE FAMILY / 2025
Qwen3-235B-A22B
TOTAL235Bparameters
ACTIVE22Bper token
DEPTH94repeated blocks
HIDDEN4,096main trunk
CONTEXT40K / 131Knative tokens
CHECKPOINT≈470GB94 shards · Apache-2.0
INPUT100.0KTEXT
TRANSFORMER STACK94 MOE BLOCKSGQA + Qwen MoE in every decoder layer
RMSNorm Residual
++
OUTPUT1.0KTOKENS
wraps every repeated block
GROUPED-QUERY ATTENTION · THINKING MODE SWITCH推理模式主要由后训练与模板控制,不是另一个主干。
Qwen MoE · 235B CAPACITY22B active · total capacity ≠ active compute
DEPTH94decoder
HIDDEN4,096main trunk
HEADS64 / 4Q / KV
EXPERTS128top-8
CONTEXT40Knative
PARAMS235Bflagship