MODEL ATLASBY MODEL MRI56 ADAPTERS ONLINE
OPEN ARCHITECTURE MAP

MODEL
ATLAS

2021—2022—2023—2024—2025—2026

56MODEL
PROFILES
5MODALITY
TRACKS

INCLUSION ≠ ENDORSEMENT · NO SHARED BACKBONE

CATALOG COVERAGE
20212 PROFILES20222 PROFILES20234 PROFILES20249 PROFILES202511 PROFILES202628 PROFILESOPENEXTENSIBLE
SWIPE TO EXPLORE THE MODEL FIELD
FILTER
ARCHITECTURE TIMELINE

沿着模型演进,定位每一次结构选择

年份是主索引;同一时期的模型按研究顺序聚合。卡片只保留入口决策所需信息, 完整 Graph、FLOPs、Tensor 与点评进入模型 MRI 后查看。

LONG CONTEXT · AGENTIC · MULTIMODAL
18QwenMULTIMODAL
Q3.6
2026.04 · HYBRID VLM

Qwen3.6-35B-A3B

30 层 Gated DeltaNet 与 10 层全局 Attention 交替,35.95B 容量只激活约 3B。

MODEL SIZE35.95Btotal params
ACTIVE3Bper token
DEPTH40blocks
CONTEXT262Ktokens
Gated DeltaNet ×30Full Attention ×10256-way MoENative Vision
71.92GB · BF16 · Apache-2.0OPEN MODEL MRI
19QwenAUDIO
ASR
2026.01 · STREAMING ASR

Qwen3-ASR-1.7B

24 层声学编码器接 28 层 Qwen3 解码器,统一支持流式与离线的 52 种语言/方言。

MODEL SIZE2.35Btotal params
ACTIVE2.35Bruntime path
DEPTH24 + 28blocks
CONTEXT65Kstream / unit
24L Audio Encoder28L Qwen3 DecoderStreaming / Offline52 Languages
4.70GB · BF16 · Apache-2.0OPEN MODEL MRI
20QwenAUDIO
TTS
2026.01 · 12HZ TTS

Qwen3-TTS-12Hz-1.7B

12.5Hz 多码本 audio tokenizer 配合 28 层 Talker 与 5 层 Code Predictor,实现约 97ms 首包。

MODEL SIZE1.93Btotal params
ACTIVE1.93Bruntime path
DEPTH28 + 5blocks
CONTEXT32Kstream / unit
12.5Hz CodecDual-Track Streaming28L Talker5L Code Predictor
4.54GB · BF16 · Apache-2.0OPEN MODEL MRI
21MicrosoftAUDIO
VV
2026.01 · 60-MIN ASR

VibeVoice-ASR

ConvNeXt 式双声学 tokenizer 与 28 层文本解码器单次处理最长 60 分钟,并输出说话人和时间。

MODEL SIZE8.33Btotal params
ACTIVE8.33Bruntime path
DEPTH2×7 + 28blocks
CONTEXT131Kstream / unit
60-min Single PassDual Audio TokenizerSpeaker DiarizationHotwords
16.67GB · BF16 · MITOPEN MODEL MRI
22Mistral AIAUDIO
VOX
2026.03 · FLOW TTS

Voxtral-4B-TTS-2603

26 层 3.4B 文本主干驱动 3 层声学 Flow Transformer,以 8 个 Euler 步生成 24kHz 语音。

MODEL SIZE4.0Btotal params
ACTIVE4.0Bruntime path
DEPTH26 + 3blocks
CONTEXT128Kstream / unit
3L Acoustic Flow8 Euler Steps20 Voices9 Languages
8.04GB · BF16 · CC-BY-NC-4.0OPEN MODEL MRI
23KittenMLAUDIO
KT
2026.02 · EDGE TTS

KittenTTS Nano 0.8

约 15M 参数、INT8 ONNX 仅 27.7MB,面向无 GPU CPU 语音合成;官方未声明逐层拓扑。

MODEL SIZE15Mtotal params
ACTIVE15Mruntime path
DEPTHONNX DAGblocks
CONTEXTsentencestream / unit
15M ParametersINT8 ONNXCPU Inference8 Voices
27.7MB · INT8 · Apache-2.0OPEN MODEL MRI
24OpenMOSSAUDIO
MOSS
2026.04 · 100M TTS

MOSS-TTS-Nano-100M

12 层 768 维 global-local Transformer 自回归生成 16 组音频码本,在四核 CPU 上流式合成 48kHz 立体声。

MODEL SIZE100Mtotal params
ACTIVE100Mruntime path
DEPTH12 + localblocks
CONTEXT32Kstream / unit
Global-Local Transformer16 Codebooks48kHz Stereo20 Languages
706.97MB repo · FP32 · Apache-2.0OPEN MODEL MRI
25NVIDIAAUDIO
PX
2026.03 · DUPLEX SPEECH

PersonaPlex-7B-v1

Moshi/Helium 式 7B 主干同时读取和生成 8 路 Mimi 音频码本,以文本角色提示和声音提示控制人格。

MODEL SIZE8.37Btotal params
ACTIVE8.37Bruntime path
DEPTH32blocks
CONTEXTstreamstream / unit
Full DuplexMimi 8 CodebooksText Role PromptVoice Conditioning
17.14GB · BF16 · NVIDIA Open ModelOPEN MODEL MRI
26LightricksVIDEO GEN
LTX
2026.03 · A/V GENERATION

LTX-2 19B

48 个非对称双流 DiT block 由 14B 视频分支与 5B 音频分支组成,在同一步中联合生成画面和声音。

MODEL SIZE18.88Btotal params
ACTIVE18.88Bper denoise step
DEPTH48blocks
CONTEXTvideo latentlatent grid
14B Video + 5B Audio48 Dual-Stream BlocksBidirectional A/VDistilled 8 Steps
43.3GB BF16 · BF16 / FP8 · LTX CommunityOPEN MODEL MRI
27NVIDIALLM
N3S
2026.03 · HYBRID MOE

Nemotron 3 Super 120B-A12B

88 层 Mamba-Transformer 混合主干配 512 路 LatentMoE、top-22 与 2 层 MTP,原生上下文达 1M。

MODEL SIZE123.6Btotal params
ACTIVE12.7Bper token
DEPTH88 + 2blocks
CONTEXT1Mtokens
Mamba ⇄ Attention512 Latent ExpertsTop-22MTP ×2
247.25GB · BF16 · NVIDIA Open ModelOPEN MODEL MRI
28Tele-AILLM
TC3
2026 · DENSE REASONING

TeleChat3-36B-Thinking

64 层、6,144 hidden 的标准 dense GQA 主干,结构不追求新奇,提供一个 36B 深宽平衡的基准。

MODEL SIZE36.24Btotal params
ACTIVE36.24Bper token
DEPTH64blocks
CONTEXT32Ktokens
64L Dense TrunkGQA 48/8YaRN ×4Thinking Tokens
72.48GB · BF16 · TeleChat CommunityOPEN MODEL MRI
29InterfazeAUDIO
D-ASR
2026.07 · DIFFUSION ASR

Diffusion-Gemma-ASR Small

冻结 Whisper-small 与 DiffusionGemma-26B-A4B,只训练约 42M adapter,在固定 256-token 画布上并行去噪转写。

MODEL SIZE26B + 42Mtotal params
ACTIVE≈4Bruntime path
DEPTHWhisper + 48blocks
CONTEXT256 canvasstream / unit
Masked Diffusion42M Trainable AdapterWhisper Encoder26B-A4B Backbone
191.08MB adapter · BF16 adapter · Apache-2.0OPEN MODEL MRI