Claude模型详解:为您的用例选择最佳模型

Claude models explained: choosing the best model for your use case

📅2026-07-24👤AnthropicClaude Blog
✍️翻译:DeepSeek

我们的建议:从明智的开始

Our advice: start smart

我们最常听到的问题之一是:“针对这个工作负载,我应该选择哪个模型?”随着我们发布更多模型类别和版本,答案也变得更具针对性。

本文将涵盖这些细节,包括每个模型类别的描述、选择模型时需要考虑的关键问题,以及其他最佳实践。

但暂且放下这些细节,我们的默认建议是:从最智能的通用可用模型开始,然后利用努力水平(effort level)来调整性能和成本。

通常情况下,更智能模型的每任务成本(cost-per-task)更低,尤其是在较低努力水平下,即使其每 token 价格更高。这是因为能力更强的模型通常需要的交互轮次更少,思考时间更短,就能正确完成大多数任务。从较小的模型开始,反而可能更难区分模型失败和设置失败。

当然,当出现对延迟或成本更敏感的使用场景时,你可以测试较低层级的模型,直到找到最合适的方案。

有些组织也可能选择从成本效益最高的模型开始,然后逐步提升模型类别,直到满足质量要求。我们在模型选择文档中包含了这两种方向性方法。

Claude 模型家族

The Claude model family

Mythos / Fable

Mythos 是 Anthropic 能力最强的模型类别,在多个领域都具备前沿能力。该模型类别尤其擅长编程、长时间的智能体任务,以及解决人工智能之前未能可靠处理的问题。

Mythos 类以同一底层模型的两种软件包形式发布。Claude Mythos 适用于处理双重用途网络安全和生物学工作的受信任组织,而 Claude Fable 则附加了更多安全措施,使模型可供普通公众安全使用。两者都限制数据保留,因此可以安全使用。

Opus

Opus 是我们为推理密集型企业任务设计的强大模型类别。Opus 模型在关键行业基准测试中 consistently 排名领先,例如评估知识工作的 GDPval-AA 和评估智能体编程的 Terminal-Bench 2.1。

Opus 和 Fable 之间的选择表面上可能并不清晰,因为两者在编程、长时间运行的智能体以及知识工作方面都表现出色。在实际情况下,像 Fable 这样更大的模型往往拥有更多的智慧、创造力和写作技巧,尽管其基准分数与 Opus 等模型相似。

一般经验法则是:如果你的评估或内部测试显示 Opus 在某些任务上表现困难,那么 Fable 就是答案。如果 Opus 已经达到了质量要求,那么其速度和价格特性可能使其成为更好的选择。

Sonnet

Sonnet 是我们为日常任务设计的通用模型类别。Sonnet 在性能、成本和速度之间取得了平衡,适用于最广泛的通用使用场景,包括多智能体编排(multi-agent orchestration)中的高容量子智能体。

Haiku

Haiku 是我们成本最低、速度最快的模型类别。Haiku 模型专为高频工作负载设计,其中延迟和成本至关重要。

如何选择最适合你工作负载的 Claude 模型

How to choose which Claude model is best for your workload

我们的模型类别并不针对某一种工作类型。我们不推荐为一类金融工作选择一个模型类别,为另一类科学工作选择另一个模型类别。每个 Claude 模型都经过训练,在编程、智能体任务和知识工作等领域表现出色。

模型类别之间的主要区别在于它们能够可靠处理的问题难度,以及这种能力在价格和速度上的成本。选择模型时,请问自己:

这个任务有多难? 如果它通常需要大量时间、涉及多个步骤,或者之前未被解决,那么更强大的模型类别是合适的。

延迟需求是什么? 如果模型涉及高频客户面向工作负载,那么 Sonnet 通常是最佳选择。

访问限制是什么? Mythos 仅适用于 Project Glasswing 下的组织。并非所有组织都会向所有角色提供所有模型类别。

单位经济性如何? 更高产量的生产可能更适合较低类别的模型,尤其是当评估显示这些任务能被令人满意地完成时。模型的每 token 定价不同,并且根据其能力和努力水平,每任务成本也不同。

努力水平也会影响质量、速度和成本的平衡。更高类别的模型在更高努力水平下提供最佳性能,而更高类别的模型在较低努力水平下有时可能比更小的模型更高效。

这些曲线仅供示意,并非根据基准数据绘制。

这些曲线仅供示意,并非根据基准数据绘制。

要了解更多信息,请阅读《在 Claude Code 中选择 Claude 模型和努力水平》。

利用顾问策略结合模型优势

Combining models’ strengths with the advisor strategy

顾问策略(advisor strategy)允许更快、成本更低的工作模型调用更智能的模型来检查其计划并评估其工作,从而提高性能。

这种方法中,执行模型仅在需要时才接受指导,从而大幅提升性能。例如,在 SWE-bench Pro 上,Sonnet 5 搭配 Fable 5 顾问的性能与 Fable 5 的分数相差不到 10%,而成本仅为全程使用 Fable 5 的 63%。

评估和基准测试如何帮助模型选择

How evals and benchmarks help with model choice

判断模型能力是否满足需求的两种常见方法是使用标准基准测试(benchmarks)和自定义评估(custom evaluations)。

基准测试是一组预定义的任务或场景,通常针对特定领域,且具有已知解决方案。它们可以作为评估跨模型类别和提供商的模型能力的方向性指南。但问题在于评估强大模型(如 Opus 和 Fable)时,这些模型几乎能解决测试中的所有问题(通常称为饱和)。

在这种情况下,我们建议组织在实际工作负载上使用这些模型,或用自己的评估进行测试,以决定哪个模型是正确选择。通常,评估是从生产中精选的一组问题——包括你当前工具无法胜任的困难任务,并附带你的团队定义的成功标准。

评估流程示意图

这正是前沿模型的能力和创造力开始与其余模型拉开差距、并彼此区分开来的地方。我们就开发自定义智能体评估的最佳实践撰写过大量文章。

做出明智的选择

Making the smart choice

AI 模型选择没有一刀切的方法,这也是我们提供多种模型类别的原因。最终,选择模型的最佳方式是了解每个模型类别的基础知识,并深入了解你的使用场景。这意味着要构建、维护并部署强大的评估体系。