official Stability-AI/generative-models repository, SDXL report and configs
STABILITY / TWO-STAGE LATENT DIFFUSION / 2023
Stable Diffusion XL 1.0
TOTAL≈3.5B baseparameters
ACTIVE≈3.5B / stepper denoise step
DEPTHU-Net + refinerrepeated blocks
HIDDEN320→1,280main trunk
CONTEXT1024²max canvas
CHECKPOINT≈6.94GB base1 shards · CreativeML Open RAIL++-M
INPUT1024²IMAGE CANVAS
TRANSFORMER STACKBASE U-NET → REFINERcomposition first · high-frequency detail second
Multi-Scale U-Net Skips
++
OUTPUT1024²DENOISE STEPS
wraps every repeated block
CROSS-ATTENTION U-NET · MICRO-CONDITIONING训练与推理显式输入原图尺寸、裁剪与目标尺寸,降低错误构图。
Base + Refiner SplitRefiner 只处理低噪声阶段,高频细节不必由 base 全程承担。
BASE≈3.5Bsystem
REFINERoptionalsecond model
TEXT2CLIP encoders
LATENT128²@1024
TARGET1024²pixels
STAGES2base/refiner