> For the complete documentation index, see [llms.txt](https://yeasy.gitbook.io/llm_internals/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://yeasy.gitbook.io/llm_internals/di-si-bu-fen-mo-xing-yu-qian-yan-pian/appendix/a5_volatile_facts.md).

# A.5 快变事实核验表

> 核验日期：2026-09-04；到期日期：2026-10-04。这里的模型时间线、价格、上下文、硬件可用性和 serving 生态均属于快变事实。30 天到期后，项目检查会拒绝通过，必须重新访问权威入口并更新核验元数据。**这两个日期必须与本节源文件顶部 `volatile-facts` 注释里的 `verified_at` / `expires_at` 逐字一致**——注释是项目检查唯一读取的真值，散文这份是给读者看的副本，改一处忘改另一处即为失配（已由测试断言）。
>
> **上一轮预留的检查已完成**：Kimi K3 的权重已于 **2026-07-27** 实际开放。按上一轮定下的判据实测：`moonshotai/Kimi-K3` 的 `resolve/main/config.json` 返回 **200**、仓库含 118 个文件、`gated: false`。注意仓库名只有 `moonshotai/Kimi-K3` 一个，`-Instruct` / `-Base` 两个名字返回 401（不存在或不公开），不要照抄。技术报告见 [arXiv:2607.24653](https://arxiv.org/abs/2607.24653)（2026-07-27，Kimi Team，402 位作者）。

| 类别          | 当前维护口径                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                          | 权威入口                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                     | 编辑要求                                                                                                                                                                                                                                                                                                                         |
| ----------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | -------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| 模型时间线       | OpenAI 于 2026-07-09 将 **GPT-5.6 Sol、Terra、Luna** 发布到 `v1/responses`、`v1/chat/completions` 和 `v1/batch`；`gpt-5.6` 别名指向 Sol。Anthropic 于 2026-06-30 发布 Claude Sonnet 5、2026-07-24 发布 Claude Opus 5（`claude-opus-5`）；Claude Fable 5 / Mythos 5 于 6 月 9 日发布、6 月 12 日暂停，并于 7 月 1 日恢复访问，其中 Fable 5 为 GA、Mythos 5 仅限 Project Glasswing 获批客户。Gemini 3.5 Flash 的稳定模型 ID 为 `gemini-3.5-flash`（仍为 stable/GA）。2026-09-01 起 Anthropic 发布 Claude Fable 5.1（`claude-fable-5-1`）与 Mythos 5.1，Fable 5 随之被官方模型页移入 legacy（Legacy 段现含 Fable 5、Opus 4.8/4.7/4.6/4.5、Sonnet 4.6/4.5）；2026-09-02 Google 的 `gemini-3.8-flash` 转为 New Stable，成为稳定 Flash 序列最新一档（1,048,576 输入 / 65,536 输出）；2026-09-03 OpenAI 的 GPT-6 Astra（`gpt-6-astra`）登上模型目录首位，其模型页现已不含任何受限访问表述（复核当日检索 Trusted Access / rolling out / coming soon / waitlist 均零命中）；首日分批开放的说法仅见于二手报道，全量开放范围以模型页与 changelog 为准。Google 于 2026-07-21 将 **Gemini 3.6 Flash**（`gemini-3.6-flash`，未经预览版直接 GA）与 **Gemini 3.5 Flash-Lite**（`gemini-3.5-flash-lite`）转为正式版，同日弃用 `temperature`/`top_p`/`top_k` 采样参数。 | [OpenAI API changelog](https://developers.openai.com/api/docs/changelog), [GPT-5.6 Sol](https://developers.openai.com/api/docs/models/gpt-5.6-sol), [GPT-5.6 Terra](https://developers.openai.com/api/docs/models/gpt-5.6-terra), [GPT-5.6 Luna](https://developers.openai.com/api/docs/models/gpt-5.6-luna), [Anthropic release notes](https://platform.claude.com/docs/en/release-notes/overview), [Claude Models](https://platform.claude.com/docs/en/models/overview), [Fable/Mythos access statement](https://www.anthropic.com/news/fable-mythos-access), [Gemini 3.5 Flash](https://ai.google.dev/gemini-api/docs/models/gemini-3.5-flash), [Meta AI for developers](https://developer.meta.com/ai/), [Qwen Blog](https://qwenlm.github.io/blog/) | 时间线必须区分 API、ChatGPT/网页产品和预览状态。2026-06-26 的 OpenAI 模型目录抓取曾显示 GPT-5.6 为受信任合作方预览，但更晚的 2026-07-09 官方 changelog 与独立模型详情页明确显示 API 已发布；本冲突状态为 **resolved-conflict**，以后者为准。Claude 侧“最强/旗舰”表述须区分 Fable 系（广泛发布中最强，**现为 Fable 5.1**，Mythos 同规格但仅限受邀）与 Opus 5（Opus 档）；Opus 4.8 已被官方模型页列入 legacy，不得再写成当前 Opus 代际，**Fable 5 同理不得再写成当前最强**。 |
| 开放权重前沿      | 模型时间线一行以闭源三家为主，架构披露最充分的开放权重阵营需单独跟踪。当前口径：**DeepSeek-V4**（2026-04-24 发布**预览版**，V4-Pro 1.6T 总参/49B 激活、V4-Flash 284B/13B，1M 上下文，MIT）；**Qwen3.5-397B-A17B**（397B/17B，60 层，Apache 2.0）及 Qwen3.6 系列；**MiniMax-M3**（约 428B/23B，1M 上下文）；**GLM-5**（744B/40B，MIT）及后续 GLM-5.2；**Kimi K3**（2.8T 总参/104B 激活，1M 上下文，原生视觉；**权重已于 2026-07-27 开放**，`moonshotai/Kimi-K3`，非 gated。896 路由专家、每词元激活 16 个，稀疏度 56；93 层、hidden 7168、2 个共享专家——这几项可直接从公开 `config.json` 复核）；**NVIDIA Nemotron 3** Super/Ultra（混合 Mamba-Attention MoE）。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                       | [DeepSeek API news](https://api-docs.deepseek.com/news/news260424), [DeepSeek-V4-Pro 模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro), [Qwen Blog](https://qwenlm.github.io/blog/), [Qwen3.5-397B-A17B 模型卡](https://huggingface.co/Qwen/Qwen3.5-397B-A17B), [MiniMax-M3 模型卡](https://huggingface.co/MiniMaxAI/MiniMax-M3), [zai-org (GLM)](https://huggingface.co/zai-org), [Kimi K3 页面](https://huggingface.co/moonshotai/Kimi-K3), [Kimi 平台文档](https://platform.kimi.ai/docs/models), [NVIDIA Nemotron 模型卡](https://huggingface.co/nvidia)                                                                                                                                                                                                     | 三条硬性区分：(1) **“已发布/API 可用”不等于“权重已开放”**——Kimi K3 曾长期属前者，其权重已于 2026-07-27 开放，现可写成开放权重；判断其他型号时仍按此原则逐个核实；(2) **预览版不等于正式版**——DeepSeek-V4 至今仍标注 Preview；(3) 参数量只采用官方模型卡或技术报告的表述，**不得采用 Hugging Face 侧栏自动计算的 Model size 元数据**（GLM-5.2 的“753B”即属此类）或二手报道数字。各家自研机制（CSA/HCA、KDA、MSA、Muon 变体等）的命名以**模型方自己的论文**为准，厂商间的转述常有出入。             |
| 参数与上下文      | 参数量、MoE active params、context window、max output 和 tokenizer 变更以模型卡或技术报告为准。GPT-5.6 三个层级的官方模型页均列出 1,050,000 上下文和 128,000 最大输出。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                    | 官方 model card / technical report；Llama 4、Qwen MoE 路由等细节优先看官方博客、技术报告和模型卡                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                  | 不用传闻数字补表；上下文词元不要直接换算为“百万行代码”。                                                                                                                                                                                                                                                                                                |
| 推理引擎        | vLLM、TensorRT-LLM、SGLang、TGI 等部署状态以项目文档和 release 为准。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                            | 项目官方文档 / release                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                         | 避免写“某厂商已大规模使用”，除非有公开证据。                                                                                                                                                                                                                                                                                                      |
| 硬件          | Google 已公开 TPU 8t（训练，216 GB HBM、6528 GB/s）与 TPU 8i（推理，288 GB HBM、8601 GB/s），但 Cloud TPU 当前目录仍标为 **Coming soon**；Ironwood TPU7x 已于 2026-03-31 GA。NVIDIA Vera Rubin 官方公告的措辞是**正在爬产**（“ramping into full production”，2026-05-31），同一页 Availability 段写明**量产出货自 2026 年秋季开始**；爬产不等于已交付，实际云区域和实例可用性仍需单独核验。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                              | [TPU 8t/8i technical deep dive](https://cloud.google.com/blog/products/compute/tpu-8t-and-tpu-8i-technical-deep-dive), [Cloud TPU](https://cloud.google.com/tpu), [Cloud TPU release notes](https://docs.cloud.google.com/tpu/docs/release-notes), [Vera Rubin production](https://nvidianews.nvidia.com/news/vera-rubin-full-production-agentic-ai-factory)                                                                                                                                                                                                                                                                                                                                                                                             | 把“发布/量产”“Cloud SKU 可申请”和“特定区域有库存”分开写；Coming soon 不得写成已可用。                                                                                                                                                                                                                                                                    |
| 推理引擎内部实现    | 11.10、11.11 两节按锁定版本写：vLLM 取 v0.29.0，SGLang 取正文标注的版本。模块名、类名、配置项名、默认值（如 `gpu_memory_utilization`、`--page-size`、块大小、抢占策略）均以该版本的官方文档与仓库源码为准。已知随版本变动的有：V1 默认抢占方式为重算、GPU↔CPU KV 换出已移除、KV 缓存张量布局、CUDA Graph 捕获的尺寸档数。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                   | [vLLM 文档](https://docs.vllm.ai/) 与 `vllm-project/vllm` 对应 tag 的源码；[SGLang 文档](https://docs.sglang.ai/) 与 `sgl-project/sglang` 源码                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                         | 改动正文前先核对该 tag 的源码；换版本时同步改写两节开头的版本声明，不要只改数字。                                                                                                                                                                                                                                                                                  |
| PTX 指令与架构编号 | 10.3 节引用的 `cp.async` 需 sm\_80 及以上；`tcgen05.mma` 支持 sm\_100a、sm\_101a，PTX ISA 9.0 起 sm\_101a 更名为 sm\_110a。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                       | [PTX ISA](https://docs.nvidia.com/cuda/parallel-thread-execution/)                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                       | 架构编号与指令支持列表随 PTX ISA 版本改名、增删，引用时标明所据版本。                                                                                                                                                                                                                                                                                      |
| 互连与 PCIe 速率 | 11.4、11.8 两节的换出与通信算例用到 PCIe 5.0 x16 单向 64 GB/s（扣 128b/130b 编码后约 63 GB/s）、NVLink 各代带宽。厂商规格页常把双向之和写成单一数字（如 H100 规格页的 “PCIe Gen5: 128GB/s”）。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                       | PCI-SIG 规范页；NVIDIA 产品规格页                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                 | 引用带宽时写明单向还是双向；产品页会改版，数字变动要同步正文算例。                                                                                                                                                                                                                                                                                            |
| 框架默认值       | 7.2 节的 FSDP2 `reshard_after_forward=None` 取值随单元位置而定（非根单元 True、根单元 False）；其余框架默认值同理。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                             | [PyTorch FSDP 文档](https://docs.pytorch.org/docs/stable/distributed.fsdp.fully_shard.html)                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                | 默认值随版本可变，正文引用默认值时标注框架版本。                                                                                                                                                                                                                                                                                                     |
| Benchmark   | SWE-bench、GPQA、MMLU、long-context eval 等只作为 dated snapshot。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                      | benchmark 官方站点、论文、仓库                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                     | 说明评测集、版本、是否使用工具和污染风险。                                                                                                                                                                                                                                                                                                        |
| 新近论文快照数字    | 正文引用的 2026 年新近研究（3.5.5 AttnRes 的基准增益、8.3.4 IH-Challenge 的 +10.0%、10.1.4 execution-idle 的 19.7%/10.7% 与三档负载比例、8.2.3 训练—推理失配 TIM 等）按论文当时版本记录。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                     | [AttnRes](https://arxiv.org/abs/2603.15031), [IH-Challenge](https://arxiv.org/abs/2603.10521), [Making Claude a chemist](https://www.anthropic.com/research/making-claude-a-chemist), [Execution-Idle](https://arxiv.org/abs/2604.04745), [TIM 诊断](https://arxiv.org/abs/2605.14220)                                                                                                                                                                                                                                                                                                                                                                                                                                                                     | 复核时对照 arXiv/官方页当前版本；数字变动则更新正文快照口径。TIM 一条只写论文确证的缓解手段（TIS、拒绝采样、批次不变算子）——社区二手转述里常见的 FP16 dtype、SIS、GSPO 等说法**不在该论文正文中**，未经一手核实不得补入。execution-idle 的比例**必须连同集群构成与负载类型引用**，不得写成通用结论——论文自己报告跨五组回放的能耗区间是 7%–65%；另注意 `BurstGPT Chat` 是公开 trace 的名字，不要转述成某家厂商的线上请求。                                                                   |

`conflict_status=resolved-conflict` 不是“来源永远一致”的声明，而是记录本轮已发现的 GPT-5.6 预览/已发布冲突已有明确裁决。若权威来源再次互相冲突，应先把状态改为 `open-conflict`；项目检查会失败，直到正文、附录和来源链完成重新核验并改回 `resolved-conflict`。
