MODEL
ATLAS
2021—2022—2023—2024—2025—2026
PROFILES
TRACKS
INCLUSION ≠ ENDORSEMENT · NO SHARED BACKBONE
沿着模型演进,定位每一次结构选择
年份是主索引;同一时期的模型按研究顺序聚合。卡片只保留入口决策所需信息, 完整 Graph、FLOPs、Tensor 与点评进入模型 MRI 后查看。
Qwen3.6-35B-A3B
30 层 Gated DeltaNet 与 10 层全局 Attention 交替,35.95B 容量只激活约 3B。
Qwen3-ASR-1.7B
24 层声学编码器接 28 层 Qwen3 解码器,统一支持流式与离线的 52 种语言/方言。
Qwen3-TTS-12Hz-1.7B
12.5Hz 多码本 audio tokenizer 配合 28 层 Talker 与 5 层 Code Predictor,实现约 97ms 首包。
VibeVoice-ASR
ConvNeXt 式双声学 tokenizer 与 28 层文本解码器单次处理最长 60 分钟,并输出说话人和时间。
Voxtral-4B-TTS-2603
26 层 3.4B 文本主干驱动 3 层声学 Flow Transformer,以 8 个 Euler 步生成 24kHz 语音。
KittenTTS Nano 0.8
约 15M 参数、INT8 ONNX 仅 27.7MB,面向无 GPU CPU 语音合成;官方未声明逐层拓扑。
MOSS-TTS-Nano-100M
12 层 768 维 global-local Transformer 自回归生成 16 组音频码本,在四核 CPU 上流式合成 48kHz 立体声。
PersonaPlex-7B-v1
Moshi/Helium 式 7B 主干同时读取和生成 8 路 Mimi 音频码本,以文本角色提示和声音提示控制人格。
LTX-2 19B
48 个非对称双流 DiT block 由 14B 视频分支与 5B 音频分支组成,在同一步中联合生成画面和声音。
Nemotron 3 Super 120B-A12B
88 层 Mamba-Transformer 混合主干配 512 路 LatentMoE、top-22 与 2 层 MTP,原生上下文达 1M。
TeleChat3-36B-Thinking
64 层、6,144 hidden 的标准 dense GQA 主干,结构不追求新奇,提供一个 36B 深宽平衡的基准。
Diffusion-Gemma-ASR Small
冻结 Whisper-small 与 DiffusionGemma-26B-A4B,只训练约 42M adapter,在固定 256-token 画布上并行去噪转写。