For the complete documentation index, see llms.txt. This page is also available as Markdown.

1.2 Claude 模型家族全景

1.2.1 三种尺寸,一种智慧

Anthropic 没有采取“一个模型通吃”的策略,而是推出了三个不同定位的模型系列。这种分层策略深受用户欢迎,因为它允许开发者在 智能水平 (Intelligence)响应速度 (Speed)使用成本 (Cost) 之间找到最佳平衡点。

这三个系列分别是:Opus (史诗/巨作)Sonnet (十四行诗)Haiku (俳句)

Claude Opus:史诗

  • 定位:旗舰级,最强智能。

  • 特点:拥有近乎人类专家的推理能力。它擅长处理高度复杂的任务,如创意写作、战略分析、复杂数学证明和大型系统架构设计。

  • 适用场景:当需要“最好的结果”且不在乎多等几秒钟或多付一点钱时。

    • 科研论文润色

    • 法律合同审查

    • 复杂算法编写

  • 形象比喻:一位学识渊博的大学教授。

Claude Sonnet:十四行诗

  • 定位:平衡级,企业首选。

  • 特点:这是 Claude 家族的 中流砥柱。它在大多数任务上的表现与 Opus 差距极小(甚至在编程任务上经常超越老版本的 Opus),但速度更快,成本显著低于 Opus。

  • 适用场景:绝大多数日常任务的最佳默认选择。

    • 代码生成与调试 (VS Code 插件默认首选)

    • RAG (检索增强生成)

    • 数据提取与清洗

    • 构建 Agent 工作流

  • 形象比喻:一位经验丰富的高级工程师。

Claude Haiku:俳句

  • 定位:轻量级,极致速度。

  • 特点:虽然体积小,但绝不“傻”。Claude Haiku 4.5 以 Sonnet 约 90% 的编码能力和 4-5 倍的速度,专为高并发、低延迟场景设计。

  • 适用场景

    • 即时聊天机器人 (Chatbots)

    • 内容审核 (Content Moderation)

    • 海量文档的快速摘要

    • 作为复杂 Agent 系统中的“路由器”或“分类器”

  • 形象比喻:一位动作敏捷的实习生助理。

1.2.2 模型演进史

Claude 的迭代速度令人惊叹。每一次大版本更新都标志着 AI 能力的阶跃。

早期探索:Claude 1 与 2

  • Claude 1 (2023.03): Anthropic 的首次亮相。相比当时的 GPT-3.5,它更“守规矩”,更不容易被套话。

  • Claude 2 (2023.07): 一个极其重要的里程碑。Anthropic 已于 2023 年 5 月率先把上下文窗口从 9K 扩展到 100K Token (约 7.5 万单词)(Claude 1.3 代即可用),Claude 2 将这一能力带给更广泛的公众,直接引爆了 PDF 阅读和长文档分析的市场需求。

家族化时代

2024 年 3 月,Anthropic 发布了 Claude 3 系列,正式确立了 Opus/Sonnet/Haiku 的产品矩阵。

  • Claude 3 Opus: 在当时一举超越 GPT-4,成为新的 SOTA (State of the Art) 模型。

  • 多模态能力: 全系支持视觉输入(Vision),能看懂图表和照片。

速度与智能的统一:Claude 3.5

  • Claude 3.5 Sonnet (2024.06): 这一版本被誉为“神作”。它以中等模型的成本和速度,实现了超越上一代旗舰 (Opus) 的智能。它引入了 Artifacts,改变了编程和 UI 设计的交互方式。

  • Claude 3.5 Sonnet (New) (2024.10): 进一步增强了代码能力,并首次引入 Computer Use (计算机操控)

混合推理时代:Claude 3.7

  • Claude 3.7 Sonnet (2025.02.24): 一个划时代的版本。它是 Anthropic 首个支持 Extended Thinking(扩展思考) 的模型,开创了混合推理模式——模型可以在输出答案前进行深度的内部推理与自我校验。这一能力使 Claude 在复杂数学、逻辑推理和代码分析任务上的表现显著提升,也为后续 Claude 4 系列的推理架构奠定了基础。

第四代飞跃

  • Claude Opus 4 / Sonnet 4 (2025.05): Claude 4 代标志着推理能力的重大跃迁。鉴于 Opus 4 强大的自主行动能力,Anthropic 作为预防性措施在 ASL-3 防护标准下部署它(官方明确并未认定其跨过 ASL-3 能力阈值)。

  • Claude Opus 4.1 (2025.08): 专注于 Agentic 任务和编程能力的增量升级,SWE-bench Verified 从 72.5% 提至 74.5%(+2 个百分点)。(注:Claude Opus 4 已于 2026-04-14 在 API 中 deprecated,并于 2026-06-15 retired;Claude Opus 4.1 已于 2026-06-05 deprecated,计划 2026-08-05 retired,推荐迁移到 Opus 4.8。)

  • Claude Sonnet 4.5 (2025.09): 平衡之王。在能力上匹配 Opus 4.1,但以更低的价格提供服务,迅速成为最广泛部署的模型。

  • Claude Haiku 4.5 (2025.10): 以 Sonnet 4.5 约 90% 的编码能力、4-5 倍的速度,为中小企业提供了极致性价比的选择。(注:Claude 3 Haiku 已于 2026-02-19 deprecated,并于 2026-04-20 retired;新项目应直接使用 Haiku 4.5。)

  • Claude Opus 4.5 (2025.11): 被称为“世界上最好的编码、Agent 和 Computer Use 模型”。长对话能力应按上下文窗口、提示缓存、压缩和记忆等官方能力分别核对;不要把“长对话管理”当作独立官方产品名。同时 Opus 系列价格大幅下调。

百万上下文时代:Claude 4.6

  • Claude Opus 4.6 / Sonnet 4.6 (2026.02): 均支持 1M Token 上下文窗口。Opus 4.6 在 Agentic 编码和复杂多学科推理中刷新 SOTA。Sonnet 4.6 在保持 $3/$15 定价的同时实现全面升级。

工程能力再突破:Claude Opus 4.7

  • Claude Opus 4.7 (2026.04): 在高难度软件工程、视觉分辨率和复杂多步任务一致性上相比 4.6 有显著提升(以下指标取自 Anthropic Opus 4.7 发布说明与 pricing 页,核验记录见附录 G)。SWE-bench Verified 达 87.6%(4.6 为 80.8%),Terminal-Bench 2.0 达 69.4%(4.6 为 65.4%),GPQA Diamond 达 94.2%(4.6 为 91.3%),Finance Agent 达 64.4%(4.6 为 60.7%)。定价与长上下文条款应以 Anthropic pricing page 为准;4.7 使用新 tokenizer,同一文本可能消耗 1.00–1.35 倍 token,迁移时建议监控实际成本。

Opus 档旗舰:Claude Opus 4.8

  • Claude Opus 4.8 (2026.05): 2026-05-28 发布,发布时为 Anthropic 最强的通用可用(GA)模型(2026-06-09 起该头衔由新一代 Claude Fable 5 接任,Opus 4.8 转为 Opus 档旗舰)。它在 4.7 基础上进一步改进长跨度 Agentic 编码(更少压缩、更好的压缩恢复)、推理 effort 校准与工具触发,并显著降低代码缺陷遗漏率。沿用 4.7 的 $5/$25 定价、1M 上下文与 128K 最大输出,仅支持 Adaptive Thinking(不支持 Extended Thinking),effort 在所有界面默认 high;新增研究预览的 Fast mode(speed: "fast",约 2.5× 输出速度,$10/$50)与更低的 1,024 token 缓存下限。模型 ID 为 claude-opus-4-8

研究预览:Claude Mythos Preview

  • Claude Mythos Preview (2026.04): 一款面向防御性网络安全的前沿研究预览模型,在软件漏洞发现能力上接近甚至超越顶尖人类安全研究员。它在所有主流操作系统和浏览器中发现了数千个零日漏洞,包括 OpenBSD 中一个存在 27 年的漏洞。Anthropic 以此为基础启动了 Project Glasswing 防御性安全计划,联合 AWS、Apple、Google、Microsoft、NVIDIA 等 12 家首批合作伙伴。Mythos Preview 仅通过邀请制提供(定价 $25/$125 per M tokens),不对外公开发售。

新一代命名体系:Claude Fable 5 / Mythos 5

  • Claude Fable 5 (2026.06): 模型 ID 为 claude-fable-5,定价 $10/$50,1M 上下文、128K 最大输出。6 月 12 日暂停后,Fable 5 已于 2026-07-01 恢复全球访问;Claude Mythos 5claude-mythos-5)非普遍可用,仅向 Project Glasswing 获批客户有限开放,采用邀请制且无自助注册。生产路由还需显式处理分类器返回的 stop_reason: "refusal"

Sonnet 新一代:Claude Sonnet 5

  • Claude Sonnet 5 (2026.06): API ID 为 claude-sonnet-5,1M 上下文、128K 最大输出。Adaptive Thinking 默认开启;介绍价 $2/$10 持续到 2026-08-31,之后标准价 $3/$15。它是 Sonnet 4.6 的迁移目标,但新 tokenizer、thinking 默认值和 sampling 参数限制都必须重新回归测试。

Claude Sonnet 4.5 vs Claude Sonnet 4.6 历史对比

Claude Sonnet 4.6 相比 4.5 的关键升级

维度
Sonnet 4.5
Sonnet 4.6
提升

编码与智能体能力

更强

官方口径见发布说明(SWE-bench Verified、OSWorld、Terminal-Bench 2.0 等)

长上下文理解

200K tokens

1M tokens

5 倍提升

Computer Use

✓ 支持

✓ 增强

更精准的交互

Agent 规划

✓ 支持

✓ 改进

更好的多步推理

价格

$3/$15

$3/$15

无变化

  • 编码提升: 在算法题、系统设计、代码重构上表现更稳定(具体基准分以 Sonnet 4.6 官方发布说明为准)

  • 长上下文推理: 能更好地利用 1M token 窗口处理整个代码库

  • Computer Use 增强: 对屏幕上的 UI 元素识别更准确,操作更精细

  • Agent 决策改进: 在复杂多步骤任务中的自纠正能力更强

何时升级到 4.6

本小节回顾 4.6 发布时从 4.5 迁移的历史决策;当前新项目应评测 Sonnet 5,不应把下列历史建议当成新默认值。

  • 当时的 Sonnet 4.5 用户无需立即升级

  • 当时的新项目或长上下文应用会优先评测 4.6

  • 企业应用可逐步从 4.5 迁移到 4.6,并验证两个版本的 API 兼容性

1.2.3 性能与成本对比图解

为了更直观地理解三者的区别,可以通过能力对比表来分析。

模型能力倾向对比

能力维度
Opus
Sonnet
Haiku

逻辑推理

⭐⭐⭐⭐⭐

⭐⭐⭐⭐

⭐⭐⭐

代码能力

⭐⭐⭐⭐⭐

⭐⭐⭐⭐⭐

⭐⭐⭐

响应速度

⭐⭐

⭐⭐⭐⭐

⭐⭐⭐⭐⭐

视觉理解

⭐⭐⭐⭐⭐

⭐⭐⭐⭐

⭐⭐⭐

成本经济性

⭐⭐⭐

⭐⭐⭐⭐⭐

(注:⭐越多代表该维度表现越优)

具体的 Token 成本

具体定价细节请参考 附录 E:Claude 定价与成本参考 以及 官方定价页面

以当前家族为例,Opus 4.8、Sonnet 5、Haiku 4.5 的价格与适用边界不同;Sonnet 5 在 2026-08-31 前还有介绍价,不能把临时倍率写成长期规则。具体价格以附录 E 和官方定价页为准。

1.2.4 新兴能力维度:Extended Thinking 与 Adaptive Thinking

除了传统的“智能-速度-成本”三角,Claude 正在引入新的维度:思考时间 (Thinking Budget)。 即允许模型在输出结果前,进行一段“静默思考”或“草稿纸推演”。这在处理需要深度逻辑(如复杂数学题、代码重构方案权衡)时,能显著提升准确率,但会消耗更多的推理时间与 Token。

Extended Thinking 与 Adaptive Thinking 的区分

  • Claude Fable 5: Adaptive Thinking 常开,模型始终自动决定思考深度,无需也不支持手动配置 Extended Thinking。

  • Claude Opus 4.8 / 4.7: 仅支持 Adaptive Thinkingthinking={type: "adaptive"}),模型根据任务复杂度自动决定思考深度。不支持 Extended Thinking。

  • Claude Sonnet 4.6(迁移兼容性参考): 支持 Adaptive Thinking(推荐)和 Extended Thinking;手动 budget_tokens 路径已弃用但仍可用。

  • Claude Opus 4.6: 支持 Adaptive Thinking(推荐)和 Extended Thinkingthinking={type: "enabled"},已弃用但仍可用)。

  • Claude Haiku 4.5: 支持 Extended Thinking(thinking={type: "enabled"}),但不支持 Adaptive Thinking。

详见 8.4 扩展思考

1.2.5 如何选择?

在接下来的“模型选择”章节我们会详细讨论,但这里有一个简单的法则:

“Default to Sonnet, optimize with Haiku, escalate to Opus.” “默认用 Sonnet,用 Haiku 优化成本,遇难事找 Opus。”

  1. 开发阶段:直接使用 Sonnet。它的反馈够快,智能足够高,能让开发者专注于业务逻辑而非 Prompt 调优。

  2. 上线前优化

    • 检查 Prompt 历史。如果发现大量任务只是简单的“提取 JSON”或“分类”,尝试切换到 Haiku 并微调 Prompt。节省幅度取决于输入/输出比例和缓存命中率,不能把“90%”当作通用承诺。

    • 如果发现某些复杂的长逻辑链推理(Chain of Thought)经常出错,将该特定步骤的模型切换为 Opus

  3. 混合编排:成熟的 Agent 系统往往是混合使用的。例如,用 Haiku 快速判断用户意图,然后根据意图分发给 Sonnet 或 Opus 处理。

1.2.6 展望未来

从 Claude 3 到 4.8,可以观察到三个明显的趋势:

  1. 模型能力差距缩小:Haiku 4.5 已经接近旧版旗舰水平,Sonnet 4.6 在多项指标上匹配 Opus。

  2. 价格持续下降:Opus 从 3 代的 $15/$75 降至 4.7 的 $5/$25,降幅超过 66%。

  3. 上下文窗口急剧扩大:从 200K 跃升至 1M Token,催生了全新的长文档分析和代码库级别的应用场景。

未来,或许不再需要痛苦地在成本和智能之间做取舍,AI 将像电力一样,既廉价又强大。


了解了模型家族,接下来深入挖掘 Claude 到底具体能干什么?它的六大核心能力是如何重新定义“生产力”的?

➡️ Claude 能做什么

最后更新于