main
official facebookresearch/DiT repository, models.py and paper
DIT / TRANSFORMER DIFFUSION BASELINE / 2022

DiT-XL/2

TOTAL675Mparameters
ACTIVE675Mper denoise step
DEPTH28repeated blocks
HIDDEN1,152main trunk
CONTEXT256² / 512²max canvas
CHECKPOINT≈2.7GB1 shards · CC-BY-NC
INTERACTIVE SYSTEM BLUEPRINT

MODEL MRI

DiT-XL/2 · Architecture Explorer

1024² · 50 FLOW STEPS · 385.15T arithmetic FLOPs · click any module for evidence

VERIFIED ADAPTER
INPUT1024²IMAGE CANVAS
TRANSFORMER STACK28 DIT BLOCKSstandard self-attention Transformer replaces U-Net
AdaLN-Zero Residual
++
OUTPUT1024²DENOISE STEPS
wraps every repeated block
FULL SELF-ATTENTION · COMPUTE–QUALITY SCALING论文直接展示更深、更宽或更多 token 的 DiT 有更低 FID。
AdaLN-Zero Blocks条件通过 scale、shift 与 residual gate 注入每个 Transformer block。
DEPTH28Transformer
HIDDEN1,152XL
HEADS16self-attn
PATCH2latent
FLOPS525G@512 pass
PARAMS675MDiT