official facebookresearch/DiT repository, models.py and paper
DIT / TRANSFORMER DIFFUSION BASELINE / 2022
DiT-XL/2
TOTAL675Mparameters
ACTIVE675Mper denoise step
DEPTH28repeated blocks
HIDDEN1,152main trunk
CONTEXT256² / 512²max canvas
CHECKPOINT≈2.7GB1 shards · CC-BY-NC
INPUT1024²IMAGE CANVAS
TRANSFORMER STACK28 DIT BLOCKSstandard self-attention Transformer replaces U-Net
AdaLN-Zero Residual
++
OUTPUT1024²DENOISE STEPS
wraps every repeated block
FULL SELF-ATTENTION · COMPUTE–QUALITY SCALING论文直接展示更深、更宽或更多 token 的 DiT 有更低 FID。
AdaLN-Zero Blocks条件通过 scale、shift 与 residual gate 注入每个 Transformer block。
DEPTH28Transformer
HIDDEN1,152XL
HEADS16self-attn
PATCH2latent
FLOPS525G@512 pass
PARAMS675MDiT