报告解读来源 · OpenAI Blog2026-07-29 · 3 分钟读完

编码智能体解绑科学计算瓶颈,验证与维护成为新关键

研究者角色从“实现者”变为“验证协调者”,但低成本重写可能放大维护缺口,反而分散生态。

厂商内容本文源自 OpenAI Blog,分享 Codex 等智能体应用于科学计算的探索报告,案例含 OpenAI 产品。
一分钟速览结论先行 · 门道在下面
  1. 八个科学计算案例:报告涵盖八个智能体辅助项目,主要集中于生命科学,跨越日常维护、语言迁移到 GPU 原生重构。
  2. 五个仅用 Codex:其中五个项目仅使用 Codex,三个项目结合使用 Codex 和 Claude Code。
  3. GPT‑5.5 出手:GPT‑5.5 将一个基因组数据解析库的旧版构建和打包系统替换为现代化统一过程。
  4. 自信却出错:智能体即使工作包含明显错误也常表现出自信,验证仍需人类使用外部参考或可衡量目标。
  5. 最后一公里最费力:实现迭代中,解决边缘情况和细微数值差异往往耗费最多工作量,最艰苦的部分在收尾。
1

工程劳动不再是瓶颈

智能体接手繁琐实现,速度提升

科学计算依赖的软件常常是学术论文的副产品,工程经验有限,打包、测试和长期支持都缺位,导致流程缓慢脆弱。编码智能体的出现开始改变这一局面——它们承担琐碎的实现任务,让研究人员把更多时间花在科学问题上。

仅用 Codex五个项目仅使用 Codex 完成
结合 Claude 三个项目同时使用 Codex 与 Claude Code
打个比方这就像研究人员从“包工头兼泥瓦匠”变成了“甲方设计师”:只管定义要盖什么、怎么验收,砌砖刷墙的活交给手下熟练工。
2

验证取代编写,成为新瓶颈

智能体输出快,但科学判断力缺位

各案例一致显示,智能体能高效处理范围明确的任务,却无法可靠判断其工作是否科学正确。它们甚至会对明显的错误表现出自信,让人类审查者必须找到可靠的外部参考或可衡量的验收目标,比如输出完全一致、与现有工具结果对等。

◎ 我们的判断瓶颈从“写代码”转移到“验结果”,意味着科学软件团队的技能需求也将从工程高手转向善于定义测试基准和质量标准的人。
术语卡 · 代理型 AI指能自主规划、执行多步骤任务并适应环境的 AI 系统,编码智能体是其子类,可直接生成、修改和运行代码。
3

长期维护:低成本重写是双刃剑

更多重写可能分散用户,威胁可靠性

智能体降低了实现成本,但也使许多类似的重写更容易出现,分散用户并稀释维持单一工具可靠性所需的专家注意力。成熟的科学软件携带着未文档化的约定和用户信任,仅靠翻译源码无法复现。

打个比方这好比老字号店铺的配方被迅速复制出大量山寨版,顾客眼花缭乱,而真正的秘方只在老掌柜脑子里,传不下去。
◎ 我们的判断若每个重写项目不在一开始就明确归属与长期维护计划,今天由智能体加速产出的现代化版本,明天就可能沦为又一堆被遗弃的研究代码。
来源与口径

本文为 CyberFocus 对原报告的编译解读,所有数字逐字出自原文,未作外推。 样本为 OpenAI 发布的八项智能体辅助科学计算案例,集中于生命科学;所有数字与引用均出自原文。

阅读原文 →
解读与翻译仅供学习交流使用,内容版权归原作者所有。

科学计算代理型AI

Scientific Computing Agentic AI

📅2026-07-28👤OpenAIOpenAI Blog
✍️翻译:DeepSeek

智能体人工智能时代的科学计算

Scientific Computing in the Age of Agentic AI

July 28, 2026

PublicationResearch

阅读论文(在新窗口中打开)加载中……

科学计算是学术界和工业界现代研究的核心支柱。然而,分析科学信息所需的软件却难以跟上数据生成的快速步伐。许多广泛使用的研究工具最初只是作为研究论文附带的代码,由小型学术团队构建,工程经验有限,几乎没有时间进行打包、测试、优化或长期支持。结果,科学基础设施往往依赖缓慢且脆弱的流程,需要持续维护。这些约束阻碍了发现的进程。

AI 智能体(agent)正在开始改变这一局面。通过降低工程工作的成本并承担繁琐的实现任务,它们可以帮助研究人员更快地原型化想法,开展以前不切实际的项目,并更轻松地长期维护软件。因此,科学软件变得更高效率且维护得更好,使研究人员能够将更多时间用于发现。

我们分享一份探索性的现场报告,涵盖八个智能体辅助的科学计算项目,主要集中于生命科学领域;其中五个仅使用 Codex,三个结合使用 Codex 和 Claude Code。该报告汇集了每个项目背后团队撰写的案例研究,并识别出反复出现的主题。这些项目涵盖从日常维护和针对性优化,到大规模语言迁移和 GPU 原生重构。贡献者报告说,智能体显著加速了软件开发与维护,在某些情况下帮助小型团队完成原本需要更多时间或专业工程支持的工作。但他们也强调了建立清晰、长期的责任制和对结果工具进行管理的持续挑战。

贡献者一致描述了研究人员角色从实现向验证与协调的转变:指定要构建什么,定义如何衡量正确性,以及决定项目何时可以交付。在这种新兴模式下,研究人员仍然掌控科学方向和质量标准,但智能体辅助提供了速度提升。

图表展示了从维护到工作流重构谱系上的智能体辅助科学软件项目映射。

案例研究

Case studies

现代化一个用于解析基因组数据的广泛使用库

cyvcf2 是一个用于读写基因组变异文件的 Python 库。GPT‑5.5 将该库的旧版构建和打包系统替换为一个现代化、统一的过程,使库更易于安装、测试和发布。

借助编码智能体,快速前进相当容易;但就目前而言,要在科学上走得更远,仍然需要专家指导、理解、品味和审慎。

—Brent Pedersen

反复出现的主题

Recurring themes

尽管这些项目在范围上差异很大,但它们表明编码智能体正在使工程劳动和专业技术不再成为科学计算的瓶颈。现在,瓶颈在于验证 AI 智能体的输出,这仍然依赖于人类的判断。

在各案例研究中,智能体能够有效处理具体、范围明确的任务,但无法可靠地判断其工作是否科学有效或符合预期。事实上,即使工作包含明显错误,智能体也常常表现出自信。因此,人类审查者需要找到可靠的验证方法。最有效的方法是使用外部参考或可衡量的验收目标,例如输出完全一致、与现有工具的结果对等、合适的统计行为,或使用模拟数据预先确定的答案。

另一个反复出现的主题是,这些项目通常分阶段进行,采用反馈驱动的迭代方式,而非一次性完成。贡献者将广泛的目标分解为较小的变更,然后使用中间基准和测试系统来评估和优化智能体的工作。智能体通常能快速生成初始实现,但解决边缘情况和细微的数值差异需要更长时间。完成实现的“最后一公里”往往耗费最多工作量。

总体而言,这些案例研究表明,智能体使研究人员能够将更少的时间花在实现上,更多的时间用于指导科学工作。人们定义目标,将复杂项目分解为可管理的部分,并判断结果是否科学有效。通过缓解长期存在的工程约束,智能体扩展了研究人员能够构建的内容,同时使他们能够专注于最重要的科学问题和决策。

长期管理仍然至关重要

Long-term stewardship remains essential

研究软件中的维护缺口长期拖慢迭代速度,并限制了可重复性和可靠性。对“研究代码”和组学工具(omics tools)的已发表研究(在新窗口中打开)发现,已发布的软件往往无法在新计算环境中正确安装或按文档运行,迫使研究人员花费大量时间进行配置和调试。即使是常规的改进也能为研究人员节省时间并减少计算需求,而基于性能的重构和重写能带来更大的收益。

然而,更低的实现成本也使得更容易产生许多类似的重写,从而分散用户,并分散维持任何一个工具可靠性所需的专家注意力。这使得长期管理和归属变得至关重要。成熟的科学软件携带着未文档化的约定、兼容性要求以及用户信任,仅翻译源代码是无法复现这些的。

这些案例研究展示了若干可能的推进路径。对 MHCflurry 和 cyvcf2 的更改被纳入其原始上游项目,而 rustar-aligner 则转移到新的社区管理之下,因为原项目已被废弃。在能够与现有维护者协调的情况下,应尽早开始合作。当需要独立的实现时,必须有一个明确的所有者和可信的维护计划。否则,今天的现代化重写可能成为明天的废弃代码,而不是可靠的科学基础设施。

迈向更持久的科学软件

Toward more durable scientific software

这份现场报告是回顾性和探索性的,但这些案例研究指出了科学软件开发方式的实际转变。像 Codex 这样的编码智能体可以显著降低维护、迁移、优化和新实现的成本。它们的长期科学价值仍然取决于人类关于构建什么、如何验证以及由谁维护的决策。更深刻的变化不仅仅是研究人员能够产出更多软件,而是他们能够将更多精力集中在定义、验证和管理工具上。

这些案例研究表明,智能体已经能够加速科学计算中的迭代速度。随着编码智能体的改进,研究人员将能够花费更少的时间来维持分析管道的运行,将更多时间用于推动领域进步。

  • 2026
  • Software & Engineering