official NVlabs/Sana repository, SANA 1.5 paper and model zoo
NVIDIA / LINEAR DIT / 2025
SANA 1.5 · 4.8B
TOTAL4.8Bparameters
ACTIVE4.8B / stepper denoise step
DEPTH40repeated blocks
HIDDEN2,240main trunk
CONTEXT1024² / 4Kmax canvas
CHECKPOINT≈9.6GB2 shards · Apache-2.0
INPUT1024²IMAGE CANVAS
TRANSFORMER STACK40 LINEAR DIT BLOCKSlinear attention + convolutional Mix-FFN
AdaLN Residual
++
OUTPUT1024²DENOISE STEPS
wraps every repeated block
LINEAR ATTENTION · 32× DEEP COMPRESSION比常见 8× VAE 再减少 16 倍 latent 空间位置,是效率的第一来源。
Linear DiT + Mix-FFN局部卷积补足线性 attention 的空间归纳偏置。
DEPTH40Linear DiT
HIDDEN2,2404.8B
COMPRESSION32×DC-AE
ATTENTIONlinearO(n)
TARGET4Ksupported
PARAMS4.8Blargest