official openai/whisper repository, model card and model dimensions
OPENAI / SEQ2SEQ ASR / 2023
Whisper Large-v3
TOTAL1.55Bparameters
ACTIVE1.55Bruntime path
DEPTH32 + 32repeated blocks
HIDDEN1,280main trunk
CONTEXT30s chunksstream / sequence
CHECKPOINT≈3.1GB1 shards · MIT
INPUT30SECONDS
TRANSFORMER STACK32L ENCODER + 32L DECODERbidirectional audio encoder → causal cross-attention decoder
Dual Transformer Residual
++
OUTPUT256TOKENS
wraps every repeated block
ENCODER + CROSS-ATTENTION · MULTITASK TOKEN INTERFACE传统 ASR 的多阶段决策被统一为特殊 token 序列。
Seq2Seq Transformer编码器成本随音频帧增长,decoder KV 与输出长度增长。
ENCODER32L1,280
DECODER32L1,280
HEADS20attention
WINDOW30saudio
MEL128v3
PARAMS1.55Blarge