
乐天(Rakuten)AI 业务总经理 Yusuke Kaji 自 2024 年 9 月起便开始测试 Claude 系列模型。以下是他认为 Claude Fable 5 为何成为企业级长时间运行智能代理(agent)的变革性突破。
作为乐天 AI 业务总经理,Yusuke Kaji 的职责是“寻找变革性创新的种子,并将其推广至全公司”。
Claude 便是其中一颗种子。
自 2025 年 3 月起,乐天利用 Claude Code 加速软件开发,在各业务部门部署智能代理,并为数百万客户提供 AI 功能。据 Kaji 介绍,乐天选择与 Anthropic 合作,是因为其对企业级应用的专注、领先的技术实力以及出色的产品品味。
在近十次模型发布中,他亲眼见证了可以交给智能代理完成的任务规模不断扩大:最初使用 Claude Code 交付生产级软件,随后为全公司各团队构建定制化的 Claude Managed Agents。他将测试新模型比作开启“新的征程”。
“就像优秀的领导者为下属设定具有挑战性的目标一样,我们也会为新的 Claude 准备具有挑战性的任务,”他补充道,“或许 Claude 也在推动我们不断突破。”
当他测试 Claude Fable 5 时,他意识到这次的感觉截然不同。该模型能够比前代模型自主运行更长时间,并且首次实现了在 Kaji 睡觉时自行检查工作成果,完成那些需要细致判断的复杂任务。
正是这种更强的自主性,让乐天能够将更大、更长期的任务交给智能代理,从而彻底改变他们的工作方式。
构建 AI 原生员工队伍
Building an AI-native workforce
乐天正在围绕 AI 重塑自身,这一项目被称为“AI-nization”——这是公司层面的努力,旨在将 AI 融入为客户、业务合作伙伴和员工所做的每一件事。当 Claude Managed Agents 推出后,乐天在一周内就在产品、销售、营销和财务等部门部署了智能代理,并将其接入 Slack、Microsoft Teams 以及公司内部的任务系统。
对于 Kaji 和他的团队来说,构建智能代理的瓶颈曾经是谁会写代码;而现在,瓶颈变成了谁理解业务问题。
“现代企业的设计初衷是为了最小化沟通成本,”他说,“我相信像 Claude Code 这样的智能代理,当我们与之协作以最小化新创新的成本时,能够大放异彩——比如实现从创意到产品的快速转化。” 为有能力的人配备能够理解上下文和品味的智能代理,“就能让隐藏的才能释放潜力,并将其影响力放大 100 倍。”
然而,让智能代理在各个职能部门全天候运行,也暴露了一个新的瓶颈:人类的判断力。虽然乐天的智能代理在各个领域解决问题的速度大约快了 10 倍,但组织承接的任务数量也在持续增长。增加更多的智能代理并不能增加判断力。因此,智能代理运行得越快,组织的进展就越依赖于人类来最终闭环。
驱动可无人值守、连续运行数小时的智能代理
Powering agents that run for hours, unattended
对于大多数开发者来说,构建长时间运行的智能代理最困难的部分,是让它们能够在最少监督下成功完成任务。将其连接到正确的工具和上下文是一回事,但根据 Kaji 的经验,智能代理能够在不需人工介入验证其工作的情况下运行的时间总是存在限制。
在 Claude Fable 5 出现之前,让一个智能代理在没有人类监督的情况下处理一个长达数小时的任务,总是一场赌博。“如果它们在第一步就选择了正确的路径,那么一切顺利,”Kaji 说,“但如果它们在第一次尝试时就选错了方向,智能代理就会花费大量时间来修正路径,甚至最终无法到达目的地。” 对于一个本应运行五小时或一整天的任务,一个早期的错误假设就可能毁掉整个运行过程,而唯一能发现这个问题的方法就是有人去检查。
这种失败模式源于缺乏自我验证能力。任何模型都可能迈出错误的第一步。早期模型的问题在于,它们在运行过程中不会检查自己的工作,因此早期的错误转向不会被发现。这个问题会在运行过程中不断累积,数小时后产生一个次优的结果。
根据 Kaji 的说法,Claude Fable 5 改变了持续数天的智能代理运行的规则,因为它在运行过程中会远比任何先前模型更频繁地检查自己的工作。
“我们测试了 Fable,我们非常喜欢它的自我反思和自我验证能力,”Kaji 说,“与之前的模型相比,它在我凌晨 2 点或 3 点指出错误之前就已经意识到了自己的错误——这样我就可以安心睡觉了。”
Claude Fable 5 的独特之处
What sets Claude Fable 5 apart
Kaji 的团队指出了 Claude Fable 5 区别于前代模型的三种行为,这标志着前沿智能(frontier intelligence)的阶跃式变化:
- 它会重新检查自己的假设。 当任务状态中途发生变化时,Fable 5 会注意到并在采取行动前纠正错误的假设,而不是坚持错误的路径并在数小时后才发现问题。
- 它在每一步都回归基本原理。 它会在无需指令的情况下,根据原始意图重新验证,这种纠偏正是 Kaji 过去在运行偏离正确路径时必须亲自做的事情。
- 它与团队的品味相匹配。 即使只有最少的指导,它在处理模糊决策时的判断也与团队保持一致。Kaji 为此创造了一个术语:品味对齐(taste alignment)。“与贵公司之前的任何模型或我们使用过的任何其他模型相比,Fable 的品味对齐更加顺畅。”
最重要的是,更长的自主性改变了 Kaji 可以委派的工作单元。
“在 Fable 之前,我们必须将工作分解成定义明确的模块供智能代理执行,”他说。现在,他可以直接交办整个任务,并同时运行多个任务。
Claude Fable 5 改变了中间过程。它在每一步进行反思,捕捉早期的错误假设,并自行找到回归基本原理的路径——无需任何人引导,就能重新导航到正确的结果。由于模型能在运行中途自我修正,最终验收首次变得可行,Kaji 委派的工作单元也从任务转移到了决策。智能代理还能在运行之间保留记忆:“我们带有记忆的智能代理会记住过去会话中出错的地方,并避免重复这些错误。”
其结果是,任务的绝对数量持续攀升,但那些真正需要人类介入的任务数量保持在一个可控的水平。他说,不必中途介入并引导运行过程,是最大的生产力提升——这让他的团队能够将时间花在只有人类才能做出的决策上,并确保一个 AI 原生的组织能够加速前进,而不是因人类纠偏而停滞不前。
平衡成本与效率
Balancing cost and efficiency
前沿能力伴随着前沿价格,Kaji 直言不讳地表示,成本决定了他能部署的广度。
“作为一家大型企业,我们希望平衡智能与成本,”他说。他的团队会衡量任务完成率以及每项任务的成本,然后将那些额外能力能改变结果的工作交给 Fable 5,而让较小的模型处理其余任务。
对于 Kaji 来说,有两件事让 Fable 5 的成本效益变得划算:它能用更少的 token 和更少的错误转向完成更多工作,并且需要的指导更少。
未来展望
What’s next
Kaji 现在测试的前沿并非个人速度。而是让智能代理协调人员。Claude Code 已经加快了他自己和同事的工作速度,但任何组织的难点都在于人与人之间的对齐,即将一个人的上下文和品味与另一个人匹配。他正在探索能够“像管理者一样进行协调或组织”的智能代理,以保留那些通常在团队成员之间丢失的细微差别。
“我们不将 AI 智能代理视为未来的同事或竞争对手。它们是围绕在我们身边的系统。” 他坚持 Anthropic 自身的建议:你应该为三到六个月后即将出现的模型进行构建,而不是为眼前这个。
“我认为,作为一个社会,我们尚未为 Claude Fable 5 找到完美的模型-任务匹配,”他说,“但它已经脱颖而出,成为一款跨越了界限、进入我们世界的模型。”