12.5 快变事实核验表
verified_at: 2026-09-04 ·expires_at: 2026-10-04 ·ttl_days: 30
本表记录模型可用性、API、协议和基准等高波动事实。超过 30 天未复核时,项目检查会失败;正文不得把表中快照当成长期不变的结论。
OpenAI 模型与 API
官方模型目录以 GPT-6 Astra(gpt-6-astra)为首,其下并列 GPT-5.6 系列(Sol / Terra / Luna / Cyber);面向智能体编程的 GPT-5.3-Codex 仍在列,仍标注为迄今最强的智能体编程模型。2026-09-04 核验时 Astra 的模型页写明「正向 Trusted Access Program 的企业客户滚动开放,API 与 Plus / Pro / Business / Enterprise 计划随后开放」,即尚未全量可用;具体快照仍需按用途核对模型页。
正文只写能力边界;具体模型名、价格、上下文窗口必须标注核验日期。新旗舰在滚动开放期内不要写成「已全量可用」。
Anthropic / Claude
Fable 5 已于 2026-07-01 恢复全球访问;Mythos 5 非普遍可用,仅限 Project Glasswing 获批客户。2026-07-01 的恢复公告记录当时先恢复给一组美国机构;该事件快照不等同于当前地域限制。Claude Sonnet 5 已发布,API ID 为 claude-sonnet-5。Claude Opus 5(claude-opus-5)已于 2026-07-24 发布,官方模型页把它列为「不确定选哪个时的起点」;Claude Fable 5.1(claude-fable-5-1)与 Claude Mythos 5.1 已发布:官方模型总览页把 Fable 5.1 列入当前阵容,定位为「demanding reasoning and long-horizon agentic work」,Opus 5 仍是「不确定选哪个时的起点」;Mythos 5.1 与 Mythos 5 一样在定价页标注 limited availability,指向 Project Glasswing。同一页已把 Fable 5、Opus 4.8、Opus 4.7、Opus 4.6、Opus 4.5、Sonnet 4.6 与 Sonnet 4.5 移入 Legacy 区间(仍可用,但建议迁移),Haiku 4.5 不在其中。
6 月 12 日暂停公告与 7 月 1 日恢复公告曾形成表面冲突;以较新的恢复公告消解,并保留 Mythos 5 的受限范围。不要再把 Opus 4.8 写成当前旗舰——它的价格与上下文窗口未变,变的是它在官方目录中的位置。也不要再把 Fable 5 写成当前最强推理档——它已进入 Legacy,当前是 Fable 5.1。Mythos 系列的受限状态只在定价页有明文标注,模型总览页不列,核验时两页都要看。
Google Gemini
官方模型目录的稳定 Flash 序列以 Gemini 3.8 Flash(gemini-3.8-flash,2026-09-04 核验时标注 New Stable) 为最新,其下并列 Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash,以及 3.5 / 3.1 两档 Flash-Lite;可用地区、限额与预览状态仍以模型页为准。
避免使用“最新”“最强”等无日期表述。
向量数据库 SDK
Pinecone Python SDK 使用 pinecone 包并提供 gRPC extra;Weaviate Python 客户端使用 v4 集合 API;Chroma 的客户端示例以官方入门页为准。
代码示例必须标明依赖和服务前提,并由语法检查或离线夹具覆盖。
MCP / A2A
MCP transport、auth、roadmap 与 A2A spec 版本以官方规范仓库为准。2026-09-04 核验:MCP 最新正式修订为 2026-07-28(其前一版为 2025-11-25),A2A 最新 release tag 为 v1.0.1,而 Agent Card 中的 protocolVersion 按 Major.Minor 写作 "1.0"。
协议字段、版本号、组织治理信息必须引用规范或 release。版本号一律以仓库的 release tag 为准,不要采信任何「当前版本」叙述页——上面那篇 roadmap 博文发表于 2026-03,正文仍写着「自 2025 年 11 月起未发新版」,在 2026-07-28 发布后已经过期;它只能当方向参考,不能当版本来源。
Benchmark
SWE-bench、Terminal-Bench、GAIA、AgentBench 等只作为 dated snapshot。
各 benchmark 官方仓库或论文
禁止把单次榜单分数写成长期能力结论。
最后更新于
