报告解读来源 · OpenAI Blog2026-07-30 · 4 分钟读完

两个API设置,让ARC-AGI-3得分翻约3倍:测的不只是模型

官方测试框架下无任何前沿模型能通过第一关,而用上保留推理和压缩后,GPT‑5.6 Sol连过六关,输出token反而减少6倍——说明基准分数极受框架设计摆布。

厂商内容本文取自OpenAI官方博客,展示其Responses API的设置优势,结论直指自家产品部署方式。
一分钟速览结论先行 · 门道在下面
  1. 初始得分仅7.8%:GPT‑5.6 Sol在ARC-AGI-3官方框架下只得7.8%,GPT‑5.5更低至0.4%。
  2. 得分提高约3倍:启用保留推理和压缩后,GPT‑5.6 Sol在公开任务集上得分提高约3倍,同时输出token减少6倍。
  3. 通关全部六关:排行榜上当前无前沿模型能通过第一关以外的关卡,而使用自家框架后GPT‑5.6 Sol通过了全部六关。
  4. 175,000字符截断:官方框架用滚动截断,上下文超175,000字符就丢弃最旧消息,导致模型遗忘早期行动。
  5. 输出token减少6倍:用压缩替代滚动截断,让GPT‑5.6 Sol以更少输出token换得更高分数。
1

高分模型,为何低分?

GPT‑5.6 Sol解过数学猜想,通关游戏,却折戟2D谜题

GPT‑5.6 Sol曾解决圈双覆盖猜想,操作纯视觉通关《Pokémon FireRed》,哪怕《Slay the Spire 2》也能拿下每日挑战。可在由2D谜题构成的ARC-AGI-3基准中,却只拿到7.8%的分数,GPT‑5.5更是近乎无法游戏,仅得0.4%。

GPT‑5.6 So7.8%官方框架得分
GPT‑5.50.4%几乎无法游戏
打个比方就好像一位破解过复杂谜题的专业玩家,却在一个简单的2D游戏里考到近乎零分,令人错愕。
2

症结在测试框架,不在模型

丢弃推理与滚动截断让智能体“失忆”

仔细检查后发现,官方框架每次动作结束就丢弃私有推理,模型每做一步都要重新理解游戏;同时采用滚动截断窗口,对话超过175,000个字符时最旧消息被删除,早期行动记录也逐渐消失。GPT‑5.6 Sol的笨拙表现,很大程度上是这两个设计所致。

术语卡 · 滚动截断当对话上下文超出长度上限(此处为175,000字符),自动删除最旧消息,模型只能看到最近的内容,相当于一边答题一边撕掉前面的题目和草稿。
◎ 我们的判断模型表现糟糕的原因并非能力不足,而是不断被迫“失忆”——既记不住之前的思考,连做过什么动作也逐渐看不清。这揭示出基准测试中框架选择的影响可能远超模型本身。
3

保留推理+压缩,三倍逆转

用Responses API还原创设环境,结果截然相反

换成OpenAI在生产环境中使用的Responses API后,保留推理让模型每步都能记住先前的思考,压缩则避免上下文膨胀和遗忘。只在公开任务集上,GPT‑5.6 Sol的得分即提高约3倍,输出token减少6倍,并且从无模型通过第一关的困境中突围,连通全部六关。

约3倍得分提升幅度
6倍输出token减少
打个比方如同考试允许保留草稿纸,并在每道题后自动整理笔记,考生终于能连贯思考、高效答题。
4

评估的隐形变量

基准分数往往同时衡量框架适配度

该实验提醒,评估结果不只是模型能力的读数,还捆绑了API设置、测试框架设计与提示选择。当官方排行榜上无一模型能通过第一关,而更换为原生API后同一模型通关全部六关,落差之大已足够说明问题。

◎ 我们的判断排行榜的惨淡分数,更可能是通用框架与模型的生产部署方式不匹配所致。使用保留推理与压缩,才能让评估接近ChatGPT和Codex中的实际表现。
来源与口径

本文为 CyberFocus 对原报告的编译解读,所有数字逐字出自原文,未作外推。 样本为ARC-AGI-3公开任务集;所有数字引自OpenAI 2026年7月29日博客。

阅读原文 →
解读与翻译仅供学习交流使用,内容版权归原作者所有。

两个设置如何将我们的Arc AGI 3分数提高三倍

How Two Settings Tripled Our Arc AGI 3 Scores

📅2026-07-29👤OpenAIOpenAI Blog
✍️翻译:DeepSeek

如何启用两个设置使我们在 ARC-AGI-3 基准测试中的得分翻了三倍

How enabling two settings tripled our scores on the ARC-AGI-3 benchmark

July 29, 2026

ResearchPublication

一段加速视频,展示 GPT‑5.6 Sol 在 ARC-AGI-3 基准测试中的谜题求解过程:左侧为官方测试框架(harness),右侧为我们的 Responses API 框架(保留推理并启用压缩)。在该排行榜上(opens in a new window),当前没有任何前沿模型能通过第一关以外的关卡。而使用我们的框架,GPT‑5.6 Sol 成功通过了全部六关。

当我们首次看到 GPT‑5.6 Sol 在 ARC-AGI-3⁠(opens in a new window)基准测试中的低分时,我们感到十分困惑。

GPT‑5.6 Sol 曾解决过数学领域长期悬而未决的问题(如圈双覆盖猜想⁠(opens in a new window)),并成功通关了像 Pokémon FireRed 这样的游戏。然而在 ARC-AGI-3(一个由 2D 谜题游戏组成的基准测试)中,GPT‑5.6 Sol 仅获得 7.8% 的分数,而 GPT‑5.5 几乎无法进行游戏,得分只有可怜的 0.4%。

是 2D 谜题游戏对我们的模型来说异常困难吗?还是别有原因?

基准测试很少单独衡量 AI 模型的能力。它们同样衡量一些不太显眼的因素:API 设置、测试框架设计以及提示词(prompting)的选择。针对 ARC-AGI-3,我们发现,启用我们在 ChatGPT 和 Codex 中使用的两个 API 设置——保留推理(retained reasoning)压缩(compaction)——在公开任务集上使得分提高了三倍,同时输出 token 减少了 6 倍。

ARC-AGI-3

ARC-AGI-3 是一个旨在衡量 AI 智能体学习与推理能力的基准测试。智能体需要探索未知的 2D 游戏,并在没有明确指令的情况下推断出游戏规则。你可以在 arcprize.org/tasks⁠(opens in a new window)上试玩 25 个演示游戏。

ARC-AGI-3 采用了一种故意保持通用性的测试框架,不提供工具或特殊功能。ARC 认为,简单的框架能更清楚地暴露模型的不足,并使模型之间的比较更加公平。相比之下,商业开发者会针对每个模型的特性和癖好来优化测试框架。

在游戏领域,GPT‑5.6 Sol 曾用纯视觉框架通关 Pokémon FireRed(由 GPT_Plays_Pokemon⁠(opens in a new window)直播)、用 Codex 计算机使用功能通关 Slay the Spire(由 EpochAI⁠(opens in a new window)直播),以及通过了 Baba Is You 的早期关卡(由 Piotr Migdał & Piotr Grabowski⁠(opens in a new window)分享)。那么 ARC-AGI-3 到底有何不同?

GPT-5.6 Sol 在 Codex 中完成 Slay the Spire 2 的随机每日挑战。

Ethan Mollick 展示了(opens in a new window)GPT‑5.6 Sol 在 Codex 中击败 Slay the Spire 2 的随机每日挑战,而该游戏的发布时间晚于 GPT‑5.6 Sol 的知识截止日期。

受 ARC 对 GPT‑5.5 缺陷的分析⁠(opens in a new window)启发,我们仔细查看了 GPT‑5.6 Sol 的一些尝试过程。与 ARC 的观察类似,我们发现模型的表现并不理想:它在每个动作上花费很长时间,且难以取得进展。

但当我们深入探究后,我们发现模型的大部分混乱并非源自模型本身,而是由测试框架中的设置导致的。

首先,我们注意到,每次游戏动作结束后,所有的私有推理(private reasoning)都被丢弃了。这意味着每执行一个动作,GPT‑5.6 Sol 都要重新理解游戏,无法记住自己之前的思考过程。模型虽然仍能看到过往动作的记录和简短的附注,但看不到这些动作背后的计划、洞察或思路。

其次,我们发现测试框架使用了滚动截断窗口(rolling truncation window),导致随着历史记录的累积,较早的动作变得不可见。这样一来,GPT‑5.6 Sol 不仅无法记住之前的思考,连之前的行动记忆也在逐渐丢失。

测试框架的这两个特性——丢弃推理和滚动截断——共同解释了为什么 GPT‑5.6 Sol 无法随着时间推移进行有效学习。

智能体在记住自己做过什么时表现最佳

Agents do best when they remember what they’ve done

我们的模型经过训练,会在输出回复或调用工具之前,通过私有推理消息(private reasoning messages)进行思考。这些私有思考消息会作为对话历史的一部分被保留。如果对话过长,我们会对其进行摘要并继续。

图示:模型推理、工具调用、对话历史以及上下文压缩如何在长期任务中协同工作。

这正是我们训练模型的方式,也是我们在 ChatGPT 和 Codex 中部署模型的方式。为了更好地匹配我们的生产环境,我们使用 Responses API⁠(opens in a new window)实现了 ARC-AGI-3 的测试框架。我们的 API 使得上下文管理变得简单:对于 GPT‑5.6,只需传递前一次的响应 ID,即可在工具调用和轮次之间自动保留推理信息。

启用保留推理后,我们观察到了两个显著变化。首先,GPT‑5.6 Sol 在每个动作前的思考时间缩短了,因为它不再需要每轮都从头理解游戏。其次,当它能够记住之前的想法时,GPT‑5.6 Sol 在持续学习和采用连贯策略方面表现得更好了。

下一个改进来自用压缩(compaction)⁠(opens in a new window)取代滚动截断——这是 Responses API 中的另一个设置。

ARC-AGI-3 测试框架通过滚动截断来处理上下文长度限制。当对话上下文超过 175,000 个字符时,最旧的消息会被丢弃。

滚动截断有两个缺点。首先,模型会丢失早期的观察和动作。其次,模型在大多数任务中运行在较为饱满的上下文窗口中,这可能会稍微影响性能。

当我们在 ARC-AGI-3 上启用压缩后,GPT‑5.6 Sol 能够更好地在较长的运行过程中保留它对每个游戏学到的知识,并以更少的输出 token 获得了更高的分数。

为了说明保留推理和启用压缩的效果,下面是一个动画,展示 GPT‑5.6 Sol 在使用不同测试框架解决一系列 ARC-AGI-3 谜题时,其 175K 上下文窗口的变化情况。

中间两列展示了不同测试框架如何使用模型上下文窗口。凭借更好的过往记忆,GPT‑5.6 Sol 每个动作的思考更少,进展更快。注意:我们的实现使用的是 175,000 token 而非字符的限制,但由于绝大多数文本都是动作网格(被我们的分词器以 1:1 的比例分词),最终效果十分相似。

综合来看,保留推理和启用压缩使得 GPT‑5.6 Sol(最大版本)的得分提高了约 3 倍,而输出 token 减少了 6 倍。

结论与建议

Conclusion and recommendations

我们希望这些实验能够提醒人们,评估很少是孤立地衡量模型——它们同时也衡量一系列不太显眼的选择,包括 API 设置、测试框架设计以及提示词。这已经不是我们第一次因公共基准测试的低分而感到惊讶,随后又发现评估运行器使用了丢弃推理消息的通用测试框架。

如果你是一位希望最大化性能的 API 开发者,我们建议使用与我们在自家产品中部署相同的设置:

  • 使用我们的 Responses API,而非旧版的 Chat Completions API
  • 保留推理(retain reasoning)
  • 启用压缩(compaction)

而如果你正在比较不同模型,我们建议依赖使用了上述设置的评估,因为它们最接近 ChatGPT 和 Codex 中的实际使用场景。

我们感谢 ARC 多年来在 AGI 评估方面的创造性工作,也感谢他们的分析启发我们在这里进行了更深入的探索。

如果你想亲自与前沿模型一较高下,请访问 arcprize.org/tasks⁠(opens in a new window)试玩公开游戏。

  • 2026