main
official openai/CLIP repository, paper and ViT-L/14 model card
OPENAI / CONTRASTIVE DUAL ENCODER / 2021

CLIP ViT-L/14

TOTAL≈428Mparameters
ACTIVE≈428Mper token
DEPTH24 + 12repeated blocks
HIDDEN1,024 / 768main trunk
CONTEXT257 patches / 77 textnative tokens
CHECKPOINT≈1.7GB1 shards · MIT code · model card terms
INTERACTIVE SYSTEM BLUEPRINT

MODEL MRI

CLIP ViT-L/14 · Architecture Explorer

1 INPUT + 333 OUTPUT · 294.15G arithmetic FLOPs · click any module for evidence

VERIFIED ADAPTER
INPUT1IMAGE ↔ TEXT EMBEDDING
TRANSFORMER STACK24L VISION + 12L TEXTindependent encoders meet only at normalized embeddings
Independent Residual Towers
++
OUTPUT333TOKENS
wraps every repeated block
BIDIRECTIONAL SELF-ATTENTION · CONTRASTIVE ALIGNMENT训练目标把匹配图文拉近、非匹配拉远,无需生成 decoder。
Projection Heads两个塔的最终表示归一化后做温度缩放的点积。
VISION24L1,024
TEXT12L768
PATCH14pixels
TEXT LEN77tokens
FUSIONnonedual tower
PARAMS≈428MViT-L/14