> For the complete documentation index, see [llms.txt](https://yeasy.gitbook.io/llm_internals/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://yeasy.gitbook.io/llm_internals/di-si-bu-fen-mo-xing-yu-qian-yan-pian/13_decoder_models/13.3_deepseek_gemini.md).

# 13.3 DeepSeek、Gemini 与其他前沿模型

13.2 节把一份稠密模型的配置读成了三笔账。稀疏模型要多算一笔：总参数与激活参数是两个数，显存按前者走，每词元 FLOPs 按后者走。本节以报告披露最充分的 DeepSeek 为主线，把“便宜”还原成可复核的因子；再看纯 RL 与蒸馏各自能把一个小模型推到哪里；最后对闭源两家只写已发表的方法，型号与版本一律指向台账。

## 13.3.1 DeepSeek-V2/V3：把成本拆成三笔账

DeepSeek-V2（2024 年）引入两项结构改动，V3（2024 年 12 月）沿用并放大。

* **多头隐向量注意力**（Multi-head Latent Attention，MLA）：不减少头数，而是把所有头的 K、V 压成一个低维隐向量，缓存里只存这个隐向量与一条带 RoPE 的旁路。机制与吸收投影见 [10.2.7 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/10_inference_optimization/10.2_kv_cache.md)。
* **DeepSeekMoE**：用大量细粒度专家加共享专家，替代少量大专家。V2 是 160 个路由专家加 2 个共享专家，V3 是 256 个路由专家加 1 个共享专家、每词元选 8 个。路由与负载均衡见 [14.2 节](/llm_internals/di-si-bu-fen-mo-xing-yu-qian-yan-pian/14_future_trends/14.2_moe.md)。

V3 的技术报告给出了完整的成本表，这让“只花了不到 600 万美元”第一次可以被逐项复算。表 13-9 把它拆开。

| 阶段    | H800 GPU 小时 | 按 2 美元/小时折算 | 这一笔买到了什么         |
| ----- | ----------: | ----------: | ---------------- |
| 预训练   |      2,664K |   532.8 万美元 | 14.8T 词元的主训练     |
| 上下文扩展 |        119K |    23.8 万美元 | 先扩到 32K，再扩到 128K |
| 后训练   |          5K |     1.0 万美元 | SFT 与 RL         |
| 合计    |      2,788K |   557.6 万美元 | 一次完整训练运行         |

表 13-9：DeepSeek-V3 的训练成本，取自 [DeepSeek-V3 技术报告](https://arxiv.org/abs/2412.19437)表 1。2 美元/小时是该报告自设的租用单价假设，不是实际支出。报告同时写明，这个口径只包含 V3 的正式训练，不含此前在架构、算法、数据上的研究与消融实验。

**为什么能压到这个数。** 把预训练那一笔换算成算力就清楚了。按 $6ND$ 且 $N$ 取激活参数 37B：

$$
6 \times 3.7 \times 10^{10} \times 1.48 \times 10^{13} = 3.29 \times 10^{24} \text{ FLOPs}
$$

除以预训练消耗的 GPU 秒数 $2{,}664{,}000 \times 3600 = 9.59 \times 10^{9}$：

$$
\frac{3.29 \times 10^{24}}{9.59 \times 10^{9}} \approx 3.4 \times 10^{14} \text{ FLOPs/s}
$$

即每张卡平均约 340 TFLOP/s。这个结果把“便宜”分解成两个因子：其一，每词元只激活 37B 而不是 671B，$6ND$ 里的 $N$ 直接小一个数量级；其二，单卡有效算力不低，说明 FP8 训练与通信重叠确实生效了。作为对照，Llama 3.1 405B 的训练算力是 $3.8 \times 10^{25}$，是 V3 的 11.6 倍。这才是“成本差距”的可复核版本。

两处口径要写清。$6ND$ 忽略注意力，也不计 MTP 模块的额外前向，所以 340 TFLOP/s 是下界。把它换算成 MFU 需要 H800 的峰值算力规格，本书不给出未经一手核实的峰值数字，因此不写 MFU。

**激活比。** $37/671 = 5.51%$。这个比值决定了权重显存与每词元计算量的分离：671B 参数按 FP8 存放也要约 671 GB，必须跨卡切分并配专家并行；而每词元的矩阵乘法只动其中 5.51%。批量小时大部分专家闲置，MoE 的效率优势在小批次下显著缩水（见 14.2.5）。

**MTP 的深度是 1。** V3 的多词元预测在下一个词元之外再多预测 1 个，报告的原话是“DeepSeek-V3 predicts the next 2 tokens through the MTP technique”；模块是顺序堆叠的，不是并行多头。报告给出第二个词元的接受率为 85%–90%，解码速度约 1.8 倍，推理时也可以直接丢弃 MTP 模块。把它当草稿头用于投机解码的算式见 [10.6 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/10_inference_optimization/10.6_speculative_decoding.md)。

**每词元 KV。** V3 的 61 层每层只缓存 576 个数，每词元 70,272 字节；同配置若改用标准 MHA 是约 3.8 MiB，相差约 57 倍。数字与推导见 10.2.7 的表 10-7。

## 13.3.2 R1-Zero 与 R1：纯 RL 走到哪，蒸馏补上什么

DeepSeek-R1（2025 年 1 月）的贡献分两半：一个纯 RL 的实验结论，一条可复现的工程流水线。流水线四个阶段各自的输入、产出与样本量已在 [14.6.3 节](/llm_internals/di-si-bu-fen-mo-xing-yu-qian-yan-pian/14_future_trends/14.6_test_time_scaling.md)逐段列出并配图，本节不重复，只取与 DeepSeek 这条模型线索相关的三件事：纯 RL 能到什么程度、蒸馏做了什么、两者相比谁更划算。

**R1-Zero：不做 SFT，直接 RL。** 从 DeepSeek-V3-Base 出发，用 GRPO 做强化学习，奖励只有规则化的两项：答案是否正确，以及是否把思考过程写进 `<think>` 标签。[R1 论文](https://arxiv.org/abs/2501.12948)明确说明模板只约束格式，不约束内容，以便观察模型自发的变化。结果是 AIME 2024 的 pass\@1 从 15.6% 升到 77.9%，再用自洽解码（即多数投票）取到 86.7%。训练中模型自发出现了自我反思、验证、动态调整策略等行为，论文称之为“顿悟时刻”。

这里有两处边界。其一，论文列举的涌现行为是 self-reflection、verification、dynamic strategy adaptation，不包括“对自身能力边界的认识”一类表述，转述时不要加码。其二，后续工作指出基座模型在 RL 之前已经会产生自我反思式输出，响应变长也部分来自目标函数的长度偏置，所以“顿悟”不宜当作定论（见 [8.2.4 节](/llm_internals/di-er-bu-fen-xun-lian-pian/08_alignment/8.2_rlhf.md)）。

**GRPO 在这里落下的是一条数据要求。** GRPO 不训价值网络，而是对同一道题采一组回答，用组内均值与标准差把奖励标准化成优势；一格算术、零优势组与长度偏差都在 [8.2.4 节](/llm_internals/di-er-bu-fen-xun-lian-pian/08_alignment/8.2_rlhf.md)，本节不重复。当组内**总奖励**完全相同时，标准差为 0；实现须在分母加小量或显式处理零方差，此时优势为零，奖励驱动的策略梯度消失。但 [R1 的目标函数](https://arxiv.org/html/2501.12948v1#S2.SS2.SSS1)另含 KL 正则项，KL 梯度仍可能非零；R1 还使用格式奖励，答案全对或全错不自动等于总奖励相同。数据难度应让模型有机会产生奖励可区分的回答，才能提供有效的相对优劣信号。R1 的四阶段流水线如何安排这批数据，见 14.6.3。

**蒸馏只做 SFT。** 论文用第三阶段那批约 80 万条样本直接微调 Qwen 与 Llama 的六个开源基座，得到 1.5B 到 70B 的蒸馏模型，并写明“for distilled models, we apply only SFT and do not include an RL stage”。这句话决定了这些模型的能力边界：它们继承的是 R1 的输出分布，没有经过自己的探索。

**自己 RL 不如被蒸馏。** 论文另做了一组对照回答“小模型能不能自己 RL 出来”：对 Qwen2.5-32B-Base 做超过 1 万步的大规模 RL，得到的 Qwen2.5-32B-Zero 在 AIME 2024 上 pass\@1 为 47.0；而蒸馏得到的 DeepSeek-R1-Distill-Qwen-32B 是 72.6。结论是在这个规模上，从强模型蒸馏比自己 RL 更有效，也更省。这一条对开源小模型的做法有直接影响：有强教师可用时，先蒸馏再考虑 RL。

## 13.3.3 DeepSeek-V4：三项升级各解决什么

DeepSeek-V4（2026 年 4 月发布预览版，正式版 V4-Flash-0731 与 V4-Pro-0813 分别于 2026 年 7 月 31 日和 8 月 13 日发布，取代预览版）把重心转向百万词元上下文的效率。该系列包含两个 MoE 模型：V4-Pro 总参数 1.6T、每词元激活 49B，V4-Flash 总参数 284B、激活 13B，两者上下文长度均为 100 万词元，权重以 MIT 协议开放。预训练规模上，V4-Flash 用了 32T 词元，V4-Pro 用了 33T 词元。官方技术报告（[DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence](https://arxiv.org/abs/2606.19348)）归纳为三项升级，每一项针对一个具体瓶颈。

* **混合注意力**，由压缩稀疏注意力（CSA）与高度压缩注意力（HCA）组合而成。它针对的是 MLA 解决不了的那一维：MLA 压缩每个词元的宽度，词元数量不变，百万词元时 70,272 字节乘一百万仍是约 70 GB。CSA 与 HCA 沿时间轴合并词元。效果是在百万词元设置下，V4-Pro 相比 DeepSeek-V3.2 只需 27% 的单词元推理浮点运算量（等效 FP8 口径）和 10% 的 KV 缓存。机制见 [10.2.8 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/10_inference_optimization/10.2_kv_cache.md)。
* **流形约束超连接**（Manifold-Constrained Hyper-Connections，mHC），作用在相邻 Transformer 块之间的残差连接上。它针对的是深层堆叠下残差路径的信息混合方式，与 [3.5 节](/llm_internals/di-yi-bu-fen-ji-chu-pian/03_components/3.5_residual.md)讨论的残差流是同一条脉络。
* **Muon 优化器**，对大部分模块改用 Muon 以获得更快收敛与更好的训练稳定性，仅嵌入层、预测头、mHC 的静态偏置与门控因子以及 RMSNorm 权重保留 AdamW。这份模块清单本身说明了 Muon 的适用范围：它作用在矩阵形状的参数上，而嵌入表、归一化权重这类不构成矩阵乘法主体的参数仍交给 AdamW（见 [6.1 节](/llm_internals/di-er-bu-fen-xun-lian-pian/06_training_techniques/6.1_loss_optimizer.md)）。

从 V2 的 MLA、V3 的 FP8 与 MoE 规模化，到 V4 沿时间轴的压缩与 Muon，这条线索始终围绕同一件事：在既定算力预算下，把每一笔开销单独找出来压掉。

## 13.3.4 Gemini 与 Claude：公开了什么，没公开什么

公开资料没有给出这两家模型足以逐项复算参数与训练算力的完整配置，但“配置不完整”不等于“没有披露结构”。本节区分已经发表的设计事实与仍未公开的细节。

**Gemini：已披露的结构与长上下文评测。** [Gemini 1.5 报告第 3 节及模型卡](https://arxiv.org/html/2403.05530v5#S3)明确说明：1.5 Pro 使用稀疏 MoE Transformer；1.5 Flash 是稠密 Transformer 解码器，注意力与前馈分支并行计算，并接受来自 Pro 的在线蒸馏。这些是可讨论的架构选择，但不足以推算层数、专家数或参数总量。评测方面，报告给出三条结果：在跨模态的长上下文检索任务上接近满分；把上下文推到至少 1,000 万词元时，下一词元预测持续改善、检索召回仍高于 99%；同期对照的 Claude 3.0 是 20 万、GPT-4 Turbo 是 12.8 万词元。报告另给出一个不靠记忆的能力检验：给模型一本使用人数不足 200 人的 Kalamang 语语法手册，让它现场学习翻译。

要注意“标称上下文”与“有效上下文”是两个概念，长度上限不保证在全长范围内都能有效利用；评测方法与失效情形见 [14.7 节](/llm_internals/di-si-bu-fen-mo-xing-yu-qian-yan-pian/14_future_trends/14.7_long_context.md)。另一处常见误算：100 万词元不等于一百万行代码，实际能装下多少行取决于语言、注释密度与分词器。关于“原生多模态”与“后接视觉编码器”两种范式的比较见 [14.4.4 节](/llm_internals/di-si-bu-fen-mo-xing-yu-qian-yan-pian/14_future_trends/14.4_multimodal.md)，未公开结构的模型不宜归入任何一侧。

**Claude：Constitutional AI 是一条两阶段流程。** [Constitutional AI](https://arxiv.org/abs/2212.08073) 把人类监督压缩成一份原则清单，其余环节由模型自己完成。监督阶段：从初始模型采样，让模型按原则对自己的回答生成批评与修订，再用修订后的回答微调原模型。RL 阶段：从微调后的模型采样出成对回答，用模型评判哪一个更好，以这份 AI 偏好数据训练偏好模型，再以它为奖励信号做 RL。论文称后半为 RLAIF。与 8.2 节的 RLHF 对照，唯一被替换掉的环节是偏好标注的来源，流程骨架不变。

**产品与版本细节的去处。** Claude Fable 5 与 Mythos 5 于 2026 年 6 月 9 日发布，6 月 12 日暂停访问后于 7 月 1 日恢复，但范围不同：Fable 5 已恢复全球访问；Mythos 5 仍非普遍可用，仅向 Project Glasswing 获批客户有限开放。型号列表、上下文与最大输出、当前代际、价格与 legacy 分组都会随官方模型页调整，一律以 [A.5 快变事实核验表](/llm_internals/di-si-bu-fen-mo-xing-yu-qian-yan-pian/appendix/a5_volatile_facts.md)为准，不在正文枚举“当前阵容”。Artifacts 与 Computer Use 这类产品能力同理：它们改变的是模型被使用的方式，不改变本书讨论的计算结构；Computer Use 的机制归入智能体一章（见 [14.5 节](/llm_internals/di-si-bu-fen-mo-xing-yu-qian-yan-pian/14_future_trends/14.5_agent_tool_use.md)）。

## 13.3.5 稀疏模型的参数对账：为什么 8×7B 不是 56B

MoE 模型的标称参数常被误读。Mixtral 8x7B 的总参数是 47B 而非 56B，原因只有一个：复制的只有 FFN。按 `mistralai/Mixtral-8x7B-v0.1` 的配置（32 层、$d = 4{,}096$、32 个 Q 头配 8 个 K/V 头、专家中间宽度 14,336、8 个专家、每词元取 2 个、词表 32,000）逐项算。

每层注意力与 Llama 3 8B 同形，41,943,040；每个专家是一份 SwiGLU FFN，$3 \times 4{,}096 \times 14{,}336 = 176{,}160{,}768$；路由器 $4{,}096 \times 8 = 32{,}768$。每层合计：

$$
41{,}943{,}040 + 8 \times 176{,}160{,}768 + 32{,}768 + 8{,}192 = 1{,}451{,}270{,}144
$$

32 层是 46,440,644,608，加上不绑定的嵌入与 LM head $2 \times 32{,}000 \times 4{,}096 = 262{,}144{,}000$，再加最后一个 RMSNorm 的 4,096，得 46,702,792,704，即 46.70B，与检查点张量总数逐位一致。每词元只走 2 个专家，激活参数是 12,879,925,248，即 12.88B。各部件的分解与占比列在表 13-10。

| 部件            |        每层 |   32 层 |    占总量 |
| ------------- | --------: | -----: | -----: |
| 注意力（各层共用，不复制） |    41.94M |  1.34B |   2.9% |
| 8 个专家的 FFN    | 1,409.29M | 45.10B |  96.6% |
| 路由器与 RMSNorm  |     0.04M |  1.31M | 0.003% |
| 嵌入 + LM head  |         — |  0.26B |   0.6% |
| 总参数           |         — | 46.70B |   100% |
| 每词元激活（Top-2）  |   394.31M | 12.88B |  27.6% |

表 13-10：Mixtral 8x7B 的参数分解。配置取自官方 `config.json`，数值由本节算式复算，总数与 Hugging Face 检查点一致。

差额可以直接算出来。Mixtral 的稠密同门 Mistral 7B 在决定参数量的字段上与它逐项相同（宽度 4,096、32 层、32 个 Q 头配 8 个 K/V 头、`intermediate_size` 14,336、词表 32,000），只是每层一个 FFN 而非八个，参数量 7,241,732,096；八个这样的独立模型合计 57,933,856,768，即 57.93B，比 Mixtral 多出 11,231,064,064。多出来的几乎全是被复制了 7 遍的非 FFN 部件：注意力 $7 \times 32 \times 41{,}943{,}040 = 9{,}395{,}240{,}960$，嵌入与 LM head $7 \times 262{,}144{,}000 = 1{,}835{,}008{,}000$，两项合计 11,230,248,960；余下的 815,104 是归一化的七份副本扣掉只有 MoE 才有的路由器。MoE 只复制 FFN，其余部件仍只有一份。

这张表给出三条读稀疏模型标称值的规则。

**总参数决定显存，激活参数决定计算。** 46.70B 按 BF16 要约 93 GB，即约 87 GiB 权重显存（[14.2 节](/llm_internals/di-si-bu-fen-mo-xing-yu-qian-yan-pian/14_future_trends/14.2_moe.md)按 GiB 记的就是这个数），而每词元的矩阵乘法只相当于 12.88B 的稠密模型。部署时前者定卡数，后者定吞吐。

**激活比随专家粒度变化很大。** Mixtral 是 27.6%（8 选 2），DeepSeek-V3 是 5.51%（256 选 8 加 1 个共享），gpt-oss-120b 是 4.4%（128 选 4）。细粒度路线把这个比值压得更低，代价是专家更多、All-to-All 通信更密。

**KV 缓存不随专家数变化。** Mixtral 与同形的稠密模型每词元 KV 完全相同，都是 $2 \times 32 \times 8 \times 128 \times 2 = 131{,}072$ 字节。MoE 省的是计算，不省缓存；要省缓存得动注意力那一侧，即 GQA、MLA 或沿时间轴压缩。

各家开放权重模型的专家数、Top-K、共享专家与总/激活参数列在 [14.2 节](/llm_internals/di-si-bu-fen-mo-xing-yu-qian-yan-pian/14_future_trends/14.2_moe.md)的表 14-5；模型阵容随时间变化，当前口径见 [A.5 快变事实核验表](/llm_internals/di-si-bu-fen-mo-xing-yu-qian-yan-pian/appendix/a5_volatile_facts.md)。引用参数量时只采用官方模型卡或技术报告的表述，不采用模型托管平台侧栏自动计算的元数据。
