official openai/CLIP repository, paper and ViT-L/14 model card
OPENAI / CONTRASTIVE DUAL ENCODER / 2021
CLIP ViT-L/14
TOTAL≈428Mparameters
ACTIVE≈428Mper token
DEPTH24 + 12repeated blocks
HIDDEN1,024 / 768main trunk
CONTEXT257 patches / 77 textnative tokens
CHECKPOINT≈1.7GB1 shards · MIT code · model card terms
INPUT1IMAGE ↔ TEXT EMBEDDING
TRANSFORMER STACK24L VISION + 12L TEXTindependent encoders meet only at normalized embeddings
Independent Residual Towers
++
OUTPUT333TOKENS
wraps every repeated block
BIDIRECTIONAL SELF-ATTENTION · CONTRASTIVE ALIGNMENT训练目标把匹配图文拉近、非匹配拉远,无需生成 decoder。
Projection Heads两个塔的最终表示归一化后做温度缩放的点积。
VISION24L1,024
TEXT12L768
PATCH14pixels
TEXT LEN77tokens
FUSIONnonedual tower
PARAMS≈428MViT-L/14