EvoLib:将经验转化为演化知识

EvoLib: Turning experience into evolving knowledge

📅2026-07-31👤Microsoft ResearchMicrosoft Research
✍️翻译:DeepSeek
#实验室研究

即时概览

At a glance

  • 自监督学习(Self-supervised):EvoLib 让大语言模型在推理过程中从自身经验中学习,无需依赖真实标签或外部反馈。
  • 从经验到知识:EvoLib 将过去的尝试转化为可复用的技能(skills)和反思性洞见(reflective insights),可应用于未来任务。
  • 知识不断进化:有用的技能和洞见持续被精炼、整合和重新加权,将特定实例的观察逐步转化为越来越通用的知识。
  • 跨任务迁移学习:通过将经验转化为可复用的知识,EvoLib 帮助 AI 模型从过去的成功和失败中学习,并进化出对提升未来表现最具潜力的知识。
  • 适用于当今 AI 模型:EvoLib 不需要更新模型,因此可应用于任何通过 API 部署的黑盒语言模型和 AI 系统。

记忆已成为 AI 智能体(AI agent)的一项重要能力:存储和检索过往经历。但仅靠记忆并非学习。一堆过去的对话、推理轨迹或行动历史很快就会膨胀成庞大的经验档案,让人难以从中找出对新任务最相关的知识——更不用说精炼和进化这些知识以持续提升性能了。

人类的学习方式不同。我们不会记住过往经历的每一个细节。相反,我们记住那些重要的东西:有效的策略、需要避免的错误、以及能够跨情境迁移的技能。随着时间推移,这些经验教训被精炼成越来越通用、可复用的知识。这种将经验转化为可迁移、可进化知识的能力,是人类学习的基础之一。

在我们近期发表的论文《具有进化库的测试时学习》(Test-Time Learning with an Evolving Library)中,我们探索了 AI 系统如何以类似方式从经验中学习。我们提出了 EvoLib,一个将原始经验转化为进化知识库的框架。EvoLib 不把记忆当作不断增长的经验档案,而是从这些经验中提取可复用的知识,并在新经验到来时持续精炼。通过知识库的进化,技能变得更加通用,洞见变得更加准确,下游性能也随时间持续提升。这样,AI 智能体就能在不断积累经验的同时持续学习,而无需更新底层模型。

EvoLib 的工作原理

How EvoLib Works

播客系列 PODCAST SERIES

Daniel Carpenter、Timo Minssen、Chad Atalla 和 Kathleen Sullivan 在 Microsoft Research Podcast 中的人物头像插图

AI 测试与评估:来自科学与行业的经验

AI Testing and Evaluation: Learnings from Science and Industry

了解 Microsoft 如何从其他领域汲取经验,将评估与测试作为 AI 治理的支柱加以推进。

立即收听 Listen now

在新标签页中打开 Opens in a new tab

传统的 AI 记忆系统将原始经验存储为静态信息,而 EvoLib 则围绕 进化知识(evolving knowledge) 这一理念构建。在 EvoLib 中,一个知识单元可以是由成功解决方案提炼出的可复用技能,也可以是从错误中学习到的反思性洞见。EvoLib 并非随着时间简单累积更多记忆,而是在新经验到来时持续精炼、整合和重新加权现有知识。具体来说,我们围绕知识进化设计了以下机制:

  • 整合(Consolidation):当从新经验中提取出知识时,EvoLib 会从知识库中检索相似的知识,并尝试将它们整合为更通用、可复用的新知识。这使得知识能够超越单个经验,跨任务适用。
  • 加权机制(Weighting mechanism):EvoLib 持续更新每个知识单元的重要性,不仅基于其对当前任务的即时效用,还基于它对未来任务产生有用知识的贡献程度。随着时间推移,那些具有最大长期影响的知识自然会变得更加突出。

图 1. EvoLib 将原始经验转化为可复用的技能和洞见,然后通过整合和动态加权使其持续进化。

关键结果

Key Results

为了评估 EvoLib,我们在多种具有不同经验类型和学习需求的挑战性任务上进行了测试:

  • 解决数学推理问题
  • 在效率约束下编写代码执行给定任务
  • 做出决策以探索环境、进行交互并完成长期任务

在这些任务中,EvoLib 一致地超越了基于检索的最佳记忆方法和其他抽象记忆机制,且 token 使用更高效。

我们还评估了 EvoLib 如何通过持续进化的知识,将测试时计算(test-time compute)有效转化为性能提升。图 2 对比了 EvoLib 与两种方法:一种是孤立执行每个任务的计算扩展方法(compute scaling methods),另一种是基于强记忆的学习方法。每条曲线展示了随着测试时计算量增加,性能如何提升。

在所有三个基准测试中,EvoLib 在大部分计算量范围内都达到了更高性能,并且随着计算量增加,性能提升更快。

这些结果表明,更好的学习关键可能并非只是存储更多记忆或投入更多计算。相反,最大的收益来自于将经验转化为可复用的知识,并使其持续精炼和跨任务应用。

图 2. 在所有任务中,EvoLib 将测试时计算转化为性能增益的效果均优于现有方法。

对随机任务顺序的鲁棒性

Robustness to random task order

一个自然的问题是:这种学习是否高度依赖于任务出现的顺序?在现实世界中,AI 系统可能面临任意顺序的各种类型任务,而一个有用的学习框架应对任务顺序的随机性具有鲁棒性。为了评估这一点,我们在同一组异构任务上测量了不同任务顺序下的任务性能。我们发现,EvoLib 一致优于现有的基于记忆的学习方法,并在不同顺序下保持稳定的性能。这表明,即使任务交错出现,EvoLib 也能从多样化的任务中持续学习,这在实际场景中具有实用优势——智能体需要处理并学习来自不同用户的混合请求流,而无需依赖结构化的课程。

随着 AI 系统承担更长期、更复杂的任务,从经验中学习将变得越来越重要。AI 的未来可能不仅依赖于更大的模型和更多的计算,还依赖于那些允许系统持续积累、精炼和复用知识的机制。

EvoLib 是朝着这一愿景迈出的一步。通过将经验转化为进化的知识,它使 AI 系统在部署后能够持续改进和适应。未来的 AI 系统或许无需一次次从零开始,而是可以像人类一样,在一个进化的可复用技能与洞见库的基础上不断构建。

代码和实验结果已在 GitHub(在新标签页中打开)上公开,以支持未来关于 AI 系统中记忆与知识进化的研究。

在新标签页中打开 Opens in a new tab

相关出版物

Related publications

具有进化库的测试时学习

Test-Time Learning with an Evolving Library

认识作者

Meet the authors

Weijia Xu

高级研究员 Senior Researcher 了解更多 Learn more

Alessandro Sordoni

高级首席研究经理 Senior Principal Research Manager 了解更多 Learn more

Zelalem Gero

高级研究员 Senior Researcher 了解更多 Learn more

Michel Galley

高级首席研究经理 Senior Principal Research Manager 了解更多 Learn more

Eric Yuan

首席研究员 Principal Researcher 了解更多 Learn more

Jianfeng Gao

技术院士 & 公司副总裁 Technical Fellow & Corporate Vice President 了解更多 Learn more

研究领域

Research Areas

  • 人工智能

相关实验室

Related labs

  • Microsoft Research Lab - Redmond
  • Microsoft Research Lab – Montréal
  • Microsoft Health Futures