main
official facebookresearch/sam2 repository, SAM 2.1 config and paper
META / PROMPTABLE VIDEO SEGMENTATION / 2024

SAM 2.1 · Hiera Large

TOTAL224Mparameters
ACTIVE224Mper token
DEPTHHiera + 4 memoryrepeated blocks
HIDDEN256 memorymain trunk
CONTEXTstreaming framesnative tokens
CHECKPOINT≈898MB1 shards · Apache-2.0
INTERACTIVE SYSTEM BLUEPRINT

MODEL MRI

SAM 2.1 · Hiera Large · Architecture Explorer

3,096 INPUT + 1,000 OUTPUT · 1.87T arithmetic FLOPs · click any module for evidence

VERIFIED ADAPTER
INPUT3.1KIMAGE · VIDEO + PROMPT → MASK
TRANSFORMER STACKFRAME ENCODER + MEMORYcurrent frame attends to stored mask memories
Hierarchical Residual
++
OUTPUT1.0KTOKENS
wraps every repeated block
MEMORY ATTENTION · STREAMING MEMORY BANK每帧预测可编码回 memory,后续帧无需重跑完整历史视频。
Prompt + Mask Decoder用户提示被编码为稀疏/稠密条件并与图像特征解码成 mask。
BACKBONEHiera-Lvision
MEM ATTN4Ltransformer
MEM DIM256hidden
PROMPTS3points/box/mask
MODEstreamvideo
PARAMS224Mcheckpoint