报告解读来源 · Claude Blog2026-07-21 · 4 分钟读完

Claude Fable 5夜间自纠错,任务委派从模块升级至决策

乐天测试发现,模型在凌晨2、3点自行发现错误,开发者终于能安心睡觉;任务委派单元从定义明确的模块转变为完整的决策。

厂商内容本文为Anthropic官方博客发布的客户实践,以乐天AI总经理测试经历展示Claude Fable 5能力。
一分钟速览结论先行 · 门道在下面
  1. 测试始于2024年9月:乐天AI业务总经理自2024年9月起便开始测试Claude系列模型。
  2. 一周内部署多部门:Claude Managed Agents推出后,乐天在一周内就在产品、销售、营销和财务等部门部署了智能代理。
  3. 速度快了近10倍:乐天的智能代理在各个领域解决问题的速度大约快了10倍。
  4. 凌晨2点自我纠错:Claude Fable 5在凌晨2点或3点就会意识到自己的错误,而不必等人类来指出。
  5. 为3~6个月后的模型而建:Kaji坚持为三到六个月后即将出现的模型进行构建,而非为眼前的模型。
1

从模块化委派到决策委派

任务不必提前拆碎,模型能整体承接

在Claude Fable 5之前,乐天必须把工作分解成定义明确的模块交给智能代理执行。现在Kaji可以直接交办整个任务,并同时运行多个任务。委派的工作单元从任务转移到了决策。

之前模块化必须拆成定义明确的模块
之后整体决策直接交办整个任务
◎ 我们的判断这种转变意味着智能代理不再只是执行工具,而是开始承担过去只有人能做的取舍,但这也对模型的自我纠偏能力提出了硬要求,否则错误会在长链路中被成倍放大。
2

凌晨2点的自校验行为

不用半夜起床纠错,模型自己发现并修正

在Claude Fable 5出现之前,让智能代理在没有人类监督下处理长达数小时的任务总是一场赌博。如果第一步选错方向,就会花费大量时间修正路径,甚至无法完成。但Fable 5在运行过程中远比先前模型更频繁地检查自己的工作,能在凌晨2点或3点就意识到错误,而不是等人类发现。

打个比方就像优秀的领导者为下属设定具有挑战性的目标一样,Kaji也会为新的Claude准备具有挑战性的任务,而模型似乎也在推动他们不断突破。
约10倍解决问题速度提升
凌晨2~3点模型自我纠错时间窗口
3

品味对齐与长期记忆

模糊判断与团队一致,跨会话记住教训
术语卡 · 品味对齐Kaji自创术语,指模型在仅有最少指导时处理模糊决策的判断与团队保持一致,Fable 5的品味对齐比之前任何模型都更顺畅。

Fable 5会在每一步回归基本原理,重新检查假设,并自主验证原始意图。它还能在运行之间保留记忆,记住过去会话中出错的地方,避免重复同样的错误。这种记忆让模型的长期可靠性明显提升。

4

成本约束与未来协调者

模型更强,但部署广度仍被成本卡住

Kaji直言,前沿能力对应前沿价格,成本决定他能部署的广度。团队会衡量任务完成率和每项任务的成本,将那些额外能力能改变结果的工佐交给Fable 5,而让较小的模型处理其余任务。Fable 5能用更少的token和更少的错误转向完成更多工作,且需要的指导更少,这让成本效益变得划算。

◎ 我们的判断自主性的跃升让智能代理从“帮人干活”走向“替人决策”,但企业的部署规模仍严格受限于单任务成本,这决定了这类前沿模型短期内更像是决策层的特种部队,而非全员标配。
来源与口径

本文为 CyberFocus 对原报告的编译解读,所有数字逐字出自原文,未作外推。 样本为乐天AI团队对Claude Fable 5的体验测试;数字均出自Anthropic博客原文。

阅读原文 →
解读与翻译仅供学习交流使用,内容版权归原作者所有。

前沿实践:Rakuten 如何借助 Claude Fable 5 在一夜之间构建智能体

Working at the frontier: How Rakuten builds agents overnight with Claude Fable 5

📅2026-07-20👤AnthropicClaude Blog
✍️翻译:DeepSeek

乐天(Rakuten)AI 业务总经理 Yusuke Kaji 自 2024 年 9 月起便开始测试 Claude 系列模型。以下是他认为 Claude Fable 5 为何成为企业级长时间运行智能代理(agent)的变革性突破。

作为乐天 AI 业务总经理,Yusuke Kaji 的职责是“寻找变革性创新的种子,并将其推广至全公司”。

Claude 便是其中一颗种子。

自 2025 年 3 月起,乐天利用 Claude Code 加速软件开发,在各业务部门部署智能代理,并为数百万客户提供 AI 功能。据 Kaji 介绍,乐天选择与 Anthropic 合作,是因为其对企业级应用的专注、领先的技术实力以及出色的产品品味。

在近十次模型发布中,他亲眼见证了可以交给智能代理完成的任务规模不断扩大:最初使用 Claude Code 交付生产级软件,随后为全公司各团队构建定制化的 Claude Managed Agents。他将测试新模型比作开启“新的征程”。

“就像优秀的领导者为下属设定具有挑战性的目标一样,我们也会为新的 Claude 准备具有挑战性的任务,”他补充道,“或许 Claude 也在推动我们不断突破。”

当他测试 Claude Fable 5 时,他意识到这次的感觉截然不同。该模型能够比前代模型自主运行更长时间,并且首次实现了在 Kaji 睡觉时自行检查工作成果,完成那些需要细致判断的复杂任务。

正是这种更强的自主性,让乐天能够将更大、更长期的任务交给智能代理,从而彻底改变他们的工作方式。

构建 AI 原生员工队伍

Building an AI-native workforce

乐天正在围绕 AI 重塑自身,这一项目被称为“AI-nization”——这是公司层面的努力,旨在将 AI 融入为客户、业务合作伙伴和员工所做的每一件事。当 Claude Managed Agents 推出后,乐天在一周内就在产品、销售、营销和财务等部门部署了智能代理,并将其接入 Slack、Microsoft Teams 以及公司内部的任务系统。

对于 Kaji 和他的团队来说,构建智能代理的瓶颈曾经是谁会写代码;而现在,瓶颈变成了谁理解业务问题。

“现代企业的设计初衷是为了最小化沟通成本,”他说,“我相信像 Claude Code 这样的智能代理,当我们与之协作以最小化新创新的成本时,能够大放异彩——比如实现从创意到产品的快速转化。” 为有能力的人配备能够理解上下文和品味的智能代理,“就能让隐藏的才能释放潜力,并将其影响力放大 100 倍。”

然而,让智能代理在各个职能部门全天候运行,也暴露了一个新的瓶颈:人类的判断力。虽然乐天的智能代理在各个领域解决问题的速度大约快了 10 倍,但组织承接的任务数量也在持续增长。增加更多的智能代理并不能增加判断力。因此,智能代理运行得越快,组织的进展就越依赖于人类来最终闭环。

驱动可无人值守、连续运行数小时的智能代理

Powering agents that run for hours, unattended

对于大多数开发者来说,构建长时间运行的智能代理最困难的部分,是让它们能够在最少监督下成功完成任务。将其连接到正确的工具和上下文是一回事,但根据 Kaji 的经验,智能代理能够在不需人工介入验证其工作的情况下运行的时间总是存在限制。

在 Claude Fable 5 出现之前,让一个智能代理在没有人类监督的情况下处理一个长达数小时的任务,总是一场赌博。“如果它们在第一步就选择了正确的路径,那么一切顺利,”Kaji 说,“但如果它们在第一次尝试时就选错了方向,智能代理就会花费大量时间来修正路径,甚至最终无法到达目的地。” 对于一个本应运行五小时或一整天的任务,一个早期的错误假设就可能毁掉整个运行过程,而唯一能发现这个问题的方法就是有人去检查。

这种失败模式源于缺乏自我验证能力。任何模型都可能迈出错误的第一步。早期模型的问题在于,它们在运行过程中不会检查自己的工作,因此早期的错误转向不会被发现。这个问题会在运行过程中不断累积,数小时后产生一个次优的结果。

根据 Kaji 的说法,Claude Fable 5 改变了持续数天的智能代理运行的规则,因为它在运行过程中会远比任何先前模型更频繁地检查自己的工作。

“我们测试了 Fable,我们非常喜欢它的自我反思和自我验证能力,”Kaji 说,“与之前的模型相比,它在我凌晨 2 点或 3 点指出错误之前就已经意识到了自己的错误——这样我就可以安心睡觉了。”

Claude Fable 5 的独特之处

What sets Claude Fable 5 apart

Kaji 的团队指出了 Claude Fable 5 区别于前代模型的三种行为,这标志着前沿智能(frontier intelligence)的阶跃式变化:

  • 它会重新检查自己的假设。 当任务状态中途发生变化时,Fable 5 会注意到并在采取行动前纠正错误的假设,而不是坚持错误的路径并在数小时后才发现问题。
  • 它在每一步都回归基本原理。 它会在无需指令的情况下,根据原始意图重新验证,这种纠偏正是 Kaji 过去在运行偏离正确路径时必须亲自做的事情。
  • 它与团队的品味相匹配。 即使只有最少的指导,它在处理模糊决策时的判断也与团队保持一致。Kaji 为此创造了一个术语:品味对齐(taste alignment)。“与贵公司之前的任何模型或我们使用过的任何其他模型相比,Fable 的品味对齐更加顺畅。”

最重要的是,更长的自主性改变了 Kaji 可以委派的工作单元。

“在 Fable 之前,我们必须将工作分解成定义明确的模块供智能代理执行,”他说。现在,他可以直接交办整个任务,并同时运行多个任务。

Claude Fable 5 改变了中间过程。它在每一步进行反思,捕捉早期的错误假设,并自行找到回归基本原理的路径——无需任何人引导,就能重新导航到正确的结果。由于模型能在运行中途自我修正,最终验收首次变得可行,Kaji 委派的工作单元也从任务转移到了决策。智能代理还能在运行之间保留记忆:“我们带有记忆的智能代理会记住过去会话中出错的地方,并避免重复这些错误。”

其结果是,任务的绝对数量持续攀升,但那些真正需要人类介入的任务数量保持在一个可控的水平。他说,不必中途介入并引导运行过程,是最大的生产力提升——这让他的团队能够将时间花在只有人类才能做出的决策上,并确保一个 AI 原生的组织能够加速前进,而不是因人类纠偏而停滞不前。

平衡成本与效率

Balancing cost and efficiency

前沿能力伴随着前沿价格,Kaji 直言不讳地表示,成本决定了他能部署的广度。

“作为一家大型企业,我们希望平衡智能与成本,”他说。他的团队会衡量任务完成率以及每项任务的成本,然后将那些额外能力能改变结果的工作交给 Fable 5,而让较小的模型处理其余任务。

对于 Kaji 来说,有两件事让 Fable 5 的成本效益变得划算:它能用更少的 token 和更少的错误转向完成更多工作,并且需要的指导更少。

未来展望

What’s next

Kaji 现在测试的前沿并非个人速度。而是让智能代理协调人员。Claude Code 已经加快了他自己和同事的工作速度,但任何组织的难点都在于人与人之间的对齐,即将一个人的上下文和品味与另一个人匹配。他正在探索能够“像管理者一样进行协调或组织”的智能代理,以保留那些通常在团队成员之间丢失的细微差别。

“我们不将 AI 智能代理视为未来的同事或竞争对手。它们是围绕在我们身边的系统。” 他坚持 Anthropic 自身的建议:你应该为三到六个月后即将出现的模型进行构建,而不是为眼前这个。

“我认为,作为一个社会,我们尚未为 Claude Fable 5 找到完美的模型-任务匹配,”他说,“但它已经脱颖而出,成为一款跨越了界限、进入我们世界的模型。”