Introducing Claude Opus 5

Introducing Claude Opus 5

📅2026-07-25👤AnthropicAnthropic Blog
✍️翻译:DeepSeek

新品发布:Claude Opus 5

Product Announcements

隆重介绍 Claude Opus 5

2026 年 7 月 24 日

隆重介绍 Claude Opus 5

Claude Opus 5 现已正式发布。这是一款深思熟虑且主动积极的模型,其智能水平接近 Claude Fable 5 的前沿水平,但价格仅为后者的一半。

在 Frontier-Bench 和 GDPval-AA 等编码与知识工作评估中,Opus 5 达到了新的最先进水平,不过在网络安全任务上仍落后于 Mythos 5。

Opus 5 专为日常使用而设计:它比其他模型工作更高效。它已成为 Claude Max 的默认模型,也是 Claude Pro 上最强的模型。

性能与性价比

Performance and cost-effectiveness

Claude Opus 5 在前代产品 Opus 4.8 相同成本的基础上,性能大幅提升。本节图表展示了模型在不同“努力程度”(effort setting)设置下的性能变化,客户可以根据自身需求优化智能水平,或节省 Token 以获得更快速、更低成本的结果。

Opus 5 在重要的软件工程任务上表现出色。例如,在 Frontier-Bench v0.1 上,Opus 5 超越了所有其他模型,每任务成本更低,性能是 Opus 4.8 的两倍以上。在 CursorBench 3.2 上,以最大努力运行时,模型性能与 Fable 5 的最高分相差不到 0.5%,但每任务成本仅为一半;在“高”、“非常高”和“最大”努力级别上,它在给定成本下的性能也优于所有其他模型。

在知识工作和问题解决任务上,我们也看到了类似的结果。例如:

  • ARC-AGI 3 上(一种要求模型解决全新问题的评估),Opus 5 的得分是次优模型的三倍。
  • Zapier AutomationBench 上(衡量模型能否端到端完成商业任务),Opus 5 的通过率约为次优模型的 1.5 倍,且每任务成本相同。即使在其最低努力级别,Opus 5 通过的任务数量也超过任何其他模型。
  • OSWorld 2.0 上(一项计算机使用基准测试),Opus 5 在任意给定成本下均优于所有其他模型,以略高于 Fable 5 三分之一的成本超越了 Fable 5 的最佳结果。

在多项相关评估中,它也是我们最好且最具成本效益的模型:

对于科学研究而言,Opus 5 相比 Opus 4.8 是一次有意义的进步。在我们所有的生命科学评估中(涵盖结构生物学、有机化学和生物信息学等主题),它的表现均优于 Opus 4.8。其改进最显著的是有机化学任务,例如根据光谱数据推断分子结构(在我们内部基准测试中,得分比 Opus 4.8 高 10.2 个百分点),以及蛋白质相关任务,如预测蛋白质序列变异对其功能的影响(此处得分高 7.7 个百分点)。

最后,Opus 5 能够生成更强大的视觉输出:

使用 Claude Opus 5

Working with Claude Opus 5

Claude Opus 5 在验证自身工作和仔细迭代直至成功方面要强大得多。在评估和早期访问测试中,我们和用户发现了许多体现 Opus 5 主动性和严谨性的例子:

  • 在一个 Frontier-Bench 任务中,Opus 5 拿到了一张机器零件的图纸,并被要求编写代码将其重建为 3D FreeCAD 模型。然而,该任务有意不提供直接查看图纸的方式。Opus 5 的回应是自行编写了一套计算机视觉流水线(pipeline),从原始像素中提取几何形状,然后重建了完整的机器零件。它反复成功地做到了这一点;在相同设置下,没有竞争模型能在五次尝试后解决该问题。
  • 在一个流行的开源包管理器中存在一个真实 bug,Opus 5 找到了根本原因,并修复了社区补丁遗漏的一个边界情况。而一个竞争模型只修复了表面症状(未触及根本原因),然后报告 bug 已解决。
  • 某交易公司的一位工程师使用 Opus 5 在一个会话中为新的交易所构建了市场数据源。之前的模型根本无法完成此任务,即使有工程师提供的详尽计划。由于找不到实时的数据源进行验证,Opus 5 甚至自行构建了测试框架来检查其代码是否正确解析了交易所的数据。

以下是我们的早期访问客户关于使用 Opus 5 的一些体验报告:

在 FrontierCode 1.1 上,Claude Opus 5 以 Fable 一半的成本达到了接近 Fable 级别的性能。在 Devin 内部,它在困难的调试和根本原因分析任务上尤其出色。Claude Opus 5 以 Opus 的速度和成本提供了接近 Fable 5 的智能。在 CursorBench 上,它仅略低于 Fable 5,并具有许多相同的行为。我们很高兴看到开发者在 Cursor 中使用它。Claude Opus 5 在 Zapier 的 AutomationBench 排行榜上名列前茅,且未消耗比以往 Claude 模型更多的 Token。它获取了一个原始的账户健康工作簿,并端到端执行了完整的流失预防流程:标记高危账户、提醒相关负责人、并为留存运营团队生成总结。之前的模型未能通过;Opus 5 达到了 100%。在我们的基因组学分析工作中,Claude Opus 5 的行为比我们运行过的任何模型都更像一位仔细的科学家。它会选择合适的统计检验来排除混杂因素,通过独立方法交叉验证自己的结果,并在长时间的多步骤分析中保持专注。Claude Opus 5 在我们内部评估中超越了同系列的所有模型。它不仅在我们最困难的智能体编码任务上表现出色(比 Opus 4.7 提升 22%),而且更加稳定,运行间的方差大大降低。对于 Lovable 上的数百万构建者来说,这种一致性就是一切。可靠的结果,一次构建接着一次构建。Claude Opus 5 是 Opus 系列自 4.5 以来最大的飞跃。在同样的全栈应用构建中,前端首先体现了这一点:这是我们见过 Opus 模型给出的最佳动画、游戏和 3D 作品。我们非常喜欢 Claude Opus 5。对于我们的代理程序处理的开放式分析工作而言,它是 Opus 4.8 的严格升级,并且增益最大的地方恰恰是最关键的:更困难、更模糊的任务。回答更清晰、更简洁,同时在更高的努力级别上我们也看到了效率的提升。Claude Opus 5 对我们的分析师每天运行的金融研究工作流程来说,是 Opus 4.8 的显著改进。它在数值推理、表格处理以及需要精确度的更锐利的批判性思维方面表现突出。Claude Opus 5 提供了专业企业内容分析所需的行业智能和准确性。Box 发现,Opus 5 比 Opus 4.8 性能提升 8%,并在数据分析(提升 11%)和尽职调查(提升 17%)工作流程中带来了显著的性能提升,这些流程是技术、医疗和公共部门组织日常依赖的。Claude Opus 5 显然是 Opus 4.8 的跨代升级。在一个周末内,我让它担任我开发环境的总参谋长:它自己构建了监控器,驱动每个盒子,只在需要判断时才找我。Claude Opus 5 在我们的基础研究助手代码库中进行了大规模更改,在整个智能体工作流中适应反馈,并且比我们使用过的任何模型都更清晰地解释其推理过程。它处理了我们通常需要拆分成更小部分的工作。在我们一些最困难的金融建模任务中,Claude Opus 5 在准确性和效率方面都是 Opus 4.8 的明显提升。其性能下限明显更高,尤其是在深度金融领域逻辑上。在不同努力级别上,它平均准确率高出 9 个百分点,而轮次、工具调用减少三分之一,时间减少 60%。Claude Opus 5 会像真正的前端开发者那样检查自己的工作。在我们的基准测试中,它在桌面和手机宽度下打开自己的页面,捕捉到移动端折叠线以下隐藏的产品和屏幕外的结账按钮,并在交回工作之前修复了这两个问题。Claude Opus 5 在法律代理工作中的表现相比之前的 Opus 模型有明显提升,我们在公司治理和仲裁等实务领域看到了最大的收益。我们还对 Opus 5 在较低推理级别上保持质量的能力印象深刻:在最大推理时,它平均生成的 Token 比 Opus 4.8 少 26%,同时实现了相似的性能。Claude Opus 5 对我们最大的提升在于更长周期的工作:构建完整的演示文稿,然后进行修订。成品质量决定了我们最终使用哪个模型,而这是我们见过的最清晰的提升——更好的视觉理解、更整洁的格式、更少的幻灯片问题。Claude Opus 5 的判断力最为突出。在移交 PR 时,它不会急于发布:它会验证分支、检查模板,并思考测试的影响,以确保交接干净利落。较旧的模型往往急于推进,从而陷入我们的检查。在一次重构会话中,Claude Opus 5 对我提出的设计提出了异议,当我坚持时它并未退缩。相反,它精确解释了我想法中的宝贵之处,将反对意见缩小到单个设计问题,并提出了一个保留优点同时修正缺陷的折中方案。正是这种判断力让我们能够在较少监督下信任它。在首轮批注中,Claude Opus 5 在我们测试的所有模型中得分最高,几乎是 Opus 4.8 的两倍。评论能力也更好了:在 NDA 上,它用更少的时间和更少的轮次完成批注,准确度保持不变或更好。Claude Opus 5 编写的 diff 干净、紧凑,没有死代码,并且在细微、代码库特定的问题上具有更强的风险发现能力。我们正在将其用于生产工作负载。我们肯定会将 Cosmos(我们的统一代理平台)中的许多用例迁移过来。我们期待越来越多地使用 Claude Opus 5 进行代码审查,我可以自信地说,我们更愿意人们使用 Opus 5 而不是 Opus 4.8。Claude Opus 5 最突出的是判断力。在写下一行代码之前它会更深入地思考,在规划阶段而非事后发现自己的逻辑错误,并推理答案为何正确,而不仅仅是看它是否有效。这是我们见过从一个 Claude 模型到下一个模型最清晰的问题解决能力飞跃,我们期待在 JetBrains IDE 中看到它的应用。Claude Opus 5 是我们交易基准测试中测试过的最强 Opus 模型,而且它使用的推理 Token 约为 Opus 4.8 的七分之一,延迟不到一半。用更少的算力得到更优的答案。Claude Opus 5 让监控代理能够在生产环境中管理自己的一部分内存,使它们在更长周期内更加自主和可靠。该代理将其上下文视为一份活文档:在标记我们某个服务的潜在异常后,它重新检查了自己对生产的假设,发现信号是良性的,将修正写入其内存,并自行停止了监控查询。Claude Opus 5 是一个强大的智能体编码模型,专为长周期、多步骤的工作而构建。它深入理解你的代码库,在复杂任务中保持连贯性,并且比 Opus 4.8 更有效地确定功能开发和错误修复的需求。开发者现在可以在 Kiro 中使用 Opus 5 进行构建,利用其高级能力来应对有雄心的项目。

01 / 24

对齐与安全性

Alignment and safety

对齐(Alignment)。 在部署前测试中,我们的自动化行为审计发现 Opus 5 是迄今为止对齐程度最高的模型(如下图所示)。它比 Opus 4.8、Sonnet 5 或 Fable 5 更能遵循 Claude 的宪法;表现出最低的欺骗性行为率;并且最不容易被诱骗而误用。在避免可能产生难以逆转副作用的鲁莽行为方面,它也是我们最安全的模型。

在我们的自动化行为审计中,Opus 5 整体不对齐行为得分为 2.3,是我们近期模型中最低的。

安全性(Safety)。 Opus 5 在危险的、具有双重用途的能力方面并未推进前沿。在与私营部门和政府合作伙伴共同进行的严格评估中,我们发现它在生物学研究和攻击性网络安全方面仍落后于 Mythos 5。有关这些评估的更多信息,请参阅我们的系统卡(System Card)。

与其前代产品 Opus 4.8 一样,我们有意识地避免在网络安全任务上训练 Opus 5。然而,由于整体能力的提升,该模型在这些任务上仍然取得了实质性的进步,并且在发现网络安全漏洞方面接近 Mythos 5。然而,在利用这些漏洞——即将漏洞转化为实质性网络威胁方面——它仍然远远落后于 Mythos 5。

这一点可以从 Opus 5 在 OSS-Fuzz 上的表现看出。OSS-Fuzz 是我们开发的一项评估,用于评估模型在无需大量人工指导的情况下发现和利用漏洞的能力。虽然 Mythos 5 和 Opus 5 在发现漏洞方面的成功率相近,但 Opus 5 在漏洞利用开发方面的得分远低于 Mythos 5。

在我们的网络安全评估之一 OSS-Fuzz 上,Opus 5 在识别软件漏洞方面(左)接近 Mythos 5,但在开发漏洞利用方面(右)则逊色得多。

Opus 5 的防护措施

Safeguards for Opus 5

Claude Opus 5 的防护措施旨在允许在网络安全和生物学领域对模型进行有益使用。它们与我们应用于 Opus 4.8 的防护措施类似,只是在少数网络安全任务上增加了一些更强的护栏。

网络安全。 Opus 5 的网络安全分类器(classifier)按比例来说比 Fable 5 的约束性更弱。它们允许 Opus 5 在源代码中发现漏洞,但会阻止“基于二进制”的漏洞扫描(一种更可能与恶意行为者相关的方法)、渗透测试和漏洞利用生成。

根据我们的测试,我们预计分类器的干预频率将比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,任何被标记的请求将默认回退到 Opus 4.8。API 上也可以启用回退到 Opus 4.8。

我们的网络安全验证计划(Cyber Verification Program,CVP)有助于开展那些原本会因模型防护措施而受阻的网络安全工作。已经加入 CVP 的企业和研究人员可以立即访问一个安全限制较少的 Opus 5 版本。

生物学。 由于 Opus 5 拥有与 Opus 4.8 类似的一套防护措施,它现在是我们最强大的、可普遍用于科学研究的模型。尽管如此,该模型在长时间运行的、自主的研究任务上仍然显示出重要的局限性——而这正是我们预计 AI 模型会带来最重大生物学相关风险的领域。(Mythos 5 仍然是此类生物学工作更强的模型。)作为此次发布的一部分,那些在 Fable 5 上被阻止的生物学相关请求现在将路由到 Opus 5,而不是 Opus 4.8。

开始使用

Getting started

Claude Opus 5 现已于所有平台上架,定价为每百万输入 Token 5 美元,每百万输出 Token 25 美元(与 Opus 4.8 相同)。开发者可以通过 Claude API 使用 claude-opus-5 开始使用。

它还提供快速模式(Fast mode),运行速度约为默认速度的 2.5 倍。与 Opus 4.8 一样,快速模式可在 Claude 平台上以 Opus 5 基础价格的两倍获得,也可通过 Claude Code 中的使用积分获得。

与 Opus 5 一同,我们还在测试版中发布了两个更新:

  • Claude 平台上的对话中工具变更。在对话过程中,开发者现在可以更改 Claude 可以使用的工具,而不会使提示缓存失效。
  • API 上的自动回退。用户现在可以选择将我们的安全分类器在 Opus 5(或 Fable 5)上标记的请求自动路由到另一个模型。启用自动回退后,API 请求默认总是路由到最佳可用模型,而不是被阻止。

与之前的 Opus 模型一致,Opus 5 对于一般访问没有数据留存要求。

有关如何充分利用 Opus 5 的更多指导,请参阅我们的提示指南(prompting guide)。

脚注

Frontier-Bench v0.1, 努力程度图: 这些结果来自 Frontier-Bench v0.1 的内部运行,使用 mini-SWE-agent 框架和 GKE 后端,每任务平均奖励基于 5 次尝试。Opus 4.8 在 Opus 5 和 Fable 5 的安全分类器拒绝时作为回退模型使用。

相关内容

A research agenda for the Economic Futures Research Fund

经济未来研究基金的研究议程

我们正在分享 Anthropic 经济未来研究基金的研究议程。

阅读更多

Ask Claude about the Anthropic Economic Index

向 Claude 询问 Anthropic 经济指数

我们正在推出 Anthropic 经济指数的 Claude 连接器,让任何人都可以探索关于人工智能与工作的真实数据。

阅读更多

Anthropic is donating another $20 million to Public First Action

Anthropic 再次向 Public First Action 捐赠 2000 万美元

Anthropic 正在向 Public First Action 追加 2000 万美元的捐款,使我们的总支持金额达到 4000 万美元。

阅读更多