official config + model card · 1 BF16 shard
Z.AI / DOCUMENT INTELLIGENCE / 2026
GLM-OCR
TOTAL1.33B pkgparameters
ACTIVE≈0.9B coreper token
DEPTH24 + 16repeated blocks
HIDDEN1,536main trunk
CONTEXT128Knative tokens
CHECKPOINT2.65GB1 shards · MIT
INPUT100.0KIMAGE / PDF → TEXT
TRANSFORMER STACK24L VISION + 16L DECODERCogViT → 2×2 spatial merge → projector → GLM-0.5B-class decoder
encoder–connector–decoder residual chain
++
OUTPUT1.0KTOKENS
wraps every repeated block
GQA TEXT DECODER · TOKEN DOWNSAMPLINGCogViT 输出的 2×2 相邻 patch 在 connector 中合并,降低语言 decoder 需要处理的视觉 token 数。
CogViT EncoderCogViT 负责读取字形、布局、表格和公式;语言 decoder 不直接承担原始像素编码。
VISION24LCogViT
DECODER16LGLM
MERGE2 × 2spatial
HIDDEN1,536decoder
CONTEXT128Ktokens
PACKAGE2.65GBsingle shard