智能体人工智能时代的科学计算
Scientific Computing in the Age of Agentic AI
July 28, 2026
PublicationResearch
阅读论文(在新窗口中打开)加载中……
科学计算是学术界和工业界现代研究的核心支柱。然而,分析科学信息所需的软件却难以跟上数据生成的快速步伐。许多广泛使用的研究工具最初只是作为研究论文附带的代码,由小型学术团队构建,工程经验有限,几乎没有时间进行打包、测试、优化或长期支持。结果,科学基础设施往往依赖缓慢且脆弱的流程,需要持续维护。这些约束阻碍了发现的进程。
AI 智能体(agent)正在开始改变这一局面。通过降低工程工作的成本并承担繁琐的实现任务,它们可以帮助研究人员更快地原型化想法,开展以前不切实际的项目,并更轻松地长期维护软件。因此,科学软件变得更高效率且维护得更好,使研究人员能够将更多时间用于发现。
我们分享一份探索性的现场报告,涵盖八个智能体辅助的科学计算项目,主要集中于生命科学领域;其中五个仅使用 Codex,三个结合使用 Codex 和 Claude Code。该报告汇集了每个项目背后团队撰写的案例研究,并识别出反复出现的主题。这些项目涵盖从日常维护和针对性优化,到大规模语言迁移和 GPU 原生重构。贡献者报告说,智能体显著加速了软件开发与维护,在某些情况下帮助小型团队完成原本需要更多时间或专业工程支持的工作。但他们也强调了建立清晰、长期的责任制和对结果工具进行管理的持续挑战。
贡献者一致描述了研究人员角色从实现向验证与协调的转变:指定要构建什么,定义如何衡量正确性,以及决定项目何时可以交付。在这种新兴模式下,研究人员仍然掌控科学方向和质量标准,但智能体辅助提供了速度提升。

案例研究
Case studies
现代化一个用于解析基因组数据的广泛使用库
cyvcf2 是一个用于读写基因组变异文件的 Python 库。GPT‑5.5 将该库的旧版构建和打包系统替换为一个现代化、统一的过程,使库更易于安装、测试和发布。
借助编码智能体,快速前进相当容易;但就目前而言,要在科学上走得更远,仍然需要专家指导、理解、品味和审慎。
—Brent Pedersen
反复出现的主题
Recurring themes
尽管这些项目在范围上差异很大,但它们表明编码智能体正在使工程劳动和专业技术不再成为科学计算的瓶颈。现在,瓶颈在于验证 AI 智能体的输出,这仍然依赖于人类的判断。
在各案例研究中,智能体能够有效处理具体、范围明确的任务,但无法可靠地判断其工作是否科学有效或符合预期。事实上,即使工作包含明显错误,智能体也常常表现出自信。因此,人类审查者需要找到可靠的验证方法。最有效的方法是使用外部参考或可衡量的验收目标,例如输出完全一致、与现有工具的结果对等、合适的统计行为,或使用模拟数据预先确定的答案。
另一个反复出现的主题是,这些项目通常分阶段进行,采用反馈驱动的迭代方式,而非一次性完成。贡献者将广泛的目标分解为较小的变更,然后使用中间基准和测试系统来评估和优化智能体的工作。智能体通常能快速生成初始实现,但解决边缘情况和细微的数值差异需要更长时间。完成实现的“最后一公里”往往耗费最多工作量。
总体而言,这些案例研究表明,智能体使研究人员能够将更少的时间花在实现上,更多的时间用于指导科学工作。人们定义目标,将复杂项目分解为可管理的部分,并判断结果是否科学有效。通过缓解长期存在的工程约束,智能体扩展了研究人员能够构建的内容,同时使他们能够专注于最重要的科学问题和决策。
长期管理仍然至关重要
Long-term stewardship remains essential
研究软件中的维护缺口长期拖慢迭代速度,并限制了可重复性和可靠性。对“研究代码”和组学工具(omics tools)的已发表研究(在新窗口中打开)发现,已发布的软件往往无法在新计算环境中正确安装或按文档运行,迫使研究人员花费大量时间进行配置和调试。即使是常规的改进也能为研究人员节省时间并减少计算需求,而基于性能的重构和重写能带来更大的收益。
然而,更低的实现成本也使得更容易产生许多类似的重写,从而分散用户,并分散维持任何一个工具可靠性所需的专家注意力。这使得长期管理和归属变得至关重要。成熟的科学软件携带着未文档化的约定、兼容性要求以及用户信任,仅翻译源代码是无法复现这些的。
这些案例研究展示了若干可能的推进路径。对 MHCflurry 和 cyvcf2 的更改被纳入其原始上游项目,而 rustar-aligner 则转移到新的社区管理之下,因为原项目已被废弃。在能够与现有维护者协调的情况下,应尽早开始合作。当需要独立的实现时,必须有一个明确的所有者和可信的维护计划。否则,今天的现代化重写可能成为明天的废弃代码,而不是可靠的科学基础设施。
迈向更持久的科学软件
Toward more durable scientific software
这份现场报告是回顾性和探索性的,但这些案例研究指出了科学软件开发方式的实际转变。像 Codex 这样的编码智能体可以显著降低维护、迁移、优化和新实现的成本。它们的长期科学价值仍然取决于人类关于构建什么、如何验证以及由谁维护的决策。更深刻的变化不仅仅是研究人员能够产出更多软件,而是他们能够将更多精力集中在定义、验证和管理工具上。
这些案例研究表明,智能体已经能够加速科学计算中的迭代速度。随着编码智能体的改进,研究人员将能够花费更少的时间来维持分析管道的运行,将更多时间用于推动领域进步。
- 2026
- Software & Engineering