报告解读来源 · OpenAI Blog2026-07-31 · 4 分钟读完

GPT-5.6 Luna降价80%,一年前顶尖性能成本仅6%

Luna任务成本降至一年前顶尖模型的约6%,速度接近九倍;新快速模式让Sol响应快2.5倍且智能不变,打破了高性能必高成本的固有认知。

厂商内容本文基于OpenAI官方博客,所有数据及引述均来自OpenAI,降价与性能对比口径由OpenAI定义,请读者注意其宣传性质。
一分钟速览结论先行 · 门道在下面
  1. Luna降价八成:GPT‑5.6 Luna价格下降80%,API输入每百万Token 0.20美元,输出1.20美元。
  2. 性能等同一年前顶尖:Luna性能与一年前顶尖模型相当,每个任务成本仅约为其6%,速度接近九倍。
  3. 快速模式快2.5倍:API新增快速模式,GPT‑5.6 Sol响应速度比标准处理快2.5倍,价格为标准两倍,智能水平不变。
  4. 成本低近99%:在Agents' Last Exam上,Luna表现优于Fable 5,每个任务的估计成本低近99%。
  5. 缓存复用率从24%到90%:Replit将Luna用于工具调用智能体,提示缓存复用率从24%提升到90%,成本比GPT‑5.4 mini低87%。
1

Luna:让顶尖智能贱如水电

从一年前巅峰性能到如今成本仅6%
80%Luna降价幅度
约6%每个任务成本(vs一年前顶尖模型)
接近九倍速度提升(vs一年前顶尖模型)

OpenAI将GPT‑5.6 Luna定义为“廉价到无需计量”的模型,API输入每百万Token仅0.20美元。与一年前的顶尖模型相比,它的智能水平相当,但每个任务成本仅约为其6%,速度接近九倍。在Agents' Last Exam评测中,Luna表现优于Fable 5,而每个任务的估计成本低近99%。

打个比方这就像把去年旗舰手机的性能塞进一台百元机,且运行更流畅,让原本因预算搁置的项目突然变得可行。
◎ 我们的判断OpenAI通过Luna的定价,实际上是在企业市场推行“算力平权”——让高容量工作流几乎不计成本地接入先进智能。但这一对比基于其内部基准,实际业务中的成本下降幅度可能因任务复杂度而异。
2

Sol快速模式与Terra:快慢搭配

2.5倍加速不降智,Terra降本一半用时减60%
标准Sol基准标准处理延迟与成本
快速模式快2.5倍价格为标准2倍,智能不变

全新快速模式取代优先处理服务,向后兼容原有API请求。GPT‑5.6 Terra则降价20%,据Notion评测,它在每个任务成本降低一半、用时减少60%的情况下,达到了与GPT‑5.5相当的质量。企业可在关键流程用Sol快速模式争取时间,在大量常规任务中用Terra或Luna降低成本。

术语卡 · 快速模式一种优先调度机制,让特定请求跳过排队直接获得计算资源,从而缩短响应时间,但需支付更高单价。
3

效率内功:模型自优化与服务降本

内核重写让端到端成本下降20%,Token生成效率提高超15%

OpenAI透露,GPT‑5.6 Sol在人工主导的流程中自主重写了生产内核,设计并运行数百个实验,使模型服务端到端成本降低了20%,Token生成效率提高15%以上。这些改进直接映射到前端的降价与加速。

客户侧数据佐证了效率提升。Replit将Luna用于完整工具调用智能体循环后,提示缓存复用率从24%提升到90%,输出Token减少8.5倍,成本比GPT‑5.4 mini低87%。这意味着更少的重复计算和更经济的运行。

◎ 我们的判断效率改进已形成正向飞轮——更强大的模型帮助优化自身服务,再将增益传导至客户。当前公布的效率数字反映的是首年批量优化成果,长期能否持续同等幅度的降本,仍需观察后续代际。
来源与口径

本文为 CyberFocus 对原报告的编译解读,所有数字逐字出自原文,未作外推。 样本来源于OpenAI Blog《Advancing the price-performance frontier with GPT‑5.6》,所有数字均出自该公告原文。

阅读原文 →
解读与翻译仅供学习交流使用,内容版权归原作者所有。

以 GPT 5 6 推进性价比前沿

Advancing The Price Performance Frontier With GPT 5 6

📅2026-07-30👤OpenAIOpenAI Blog
✍️翻译:DeepSeek

以性价比前沿推进:GPT‑5.6

Advancing the price-performance frontier with GPT‑5.6

2026年7月30日

产品

通过提高每一层的效率,OpenAI 在更多企业工作负载中以更低的成本提供了更强的性能。

加载中…

昨天,我们分享了 GPT‑5.6⁠ 如何帮助自身更高效地运行。今天,我们将这些成果传递给客户:GPT‑5.6 Luna⁠(在新窗口打开)和 Terra⁠(在新窗口打开)降价,API 中的 GPT‑5.6 Sol 性能更快。这些更新共同帮助客户从每一笔 AI 投资中获得更多回报,并在时间紧迫时更快行动。

即日起,我们最快、最经济的模型 GPT‑5.6 Luna 降价 80%,面向日常工作的均衡模型 GPT‑5.6 Terra 降价 20%。这些降价同样体现在 Codex 和 ChatGPT Work 中,订阅用户的用量计算方式也相应调整。Luna 为企业提供了一种更具成本效益的方式,以极高的质量处理高容量工作。它能使用工具并完成多步骤工作流,使得更广泛的 AI 应用能够以更大规模实际运行。

让先进的智能更加丰富和廉价,是 OpenAI 确保 AGI 惠及全人类使命的核心。这些变化正是这一承诺的实践。它们体现了我们在模型构建、服务部署和应用落地方面多年来的改进成果。

我们还在 API 中引入了 快速模式(Fast mode),取代了此前的优先处理(Priority Processing)服务。对于 GPT‑5.6 Sol,快速模式现在比标准处理快 2.5 倍,价格是标准处理的两倍,智能水平不变。快速模式向后兼容:标记为 priority 的请求将自动使用快速模式。

1 / 6“GPT‑5.6 Luna 是我们迄今最接近‘廉价到无需计量’的智能模型。我从未见过如此便宜又如此强大的模型——它为 Replit 解锁了我们原本预计很久之后才会构建的用例。”“GPT‑5.6 Terra 非常适合 Notion 个人智能助手中的日常工作,包括工作区问答和对延迟敏感的限定任务。根据我们的评测,它在每个任务成本降低一半、用时减少 60% 的情况下,达到了与 GPT‑5.5 相当的质量。”“我们专注于在每项工作中最大化每美元的产出,而 GPT‑5.6 系列在这方面取得了重大进展。Terra 和 Luna 在我们内部编码基准测试中成本效率领先,Luna 现在是我们后台智能体自动化任务的默认模型。”“GPT‑5.6 Luna 是自 GPT‑4o mini 投入生产以来,我们在智能体行为方面看到的最大阶跃变化。Luna 让我们从单次结构化输出调用转向了完整的工具调用智能体循环,将提示缓存复用率从 24% 提升到 90%。在数千次生产调用中,Luna 处理了 2.2 倍的上下文,输出 Token 减少了 8.5 倍——成本比 GPT‑5.4 mini 低 87%。”“GPT‑5.6 Luna 是大型模型的理想结对编程伙伴,它在处理大量常规工作的同时,在成本与智能之间达到了理想平衡。我们已将 Luna 集成到 Devin Fusion 中,为用户在不牺牲质量的前提下显著节省成本。”“自采用 GPT‑5.6 Luna 以来,我们看到了显著的运营改进。在相同的智能体任务下,GPT‑5.6 Luna 比我们之前的默认模型快 40%,便宜 40%,为用户带来了更灵敏的体验。它在质量、速度和效率之间实现了出色的平衡。”

匹配智能与结果

Matching intelligence to the outcome

高效使用 AI 始于明确结果。风险、错误成本、紧迫性和规模决定了智能、速度、可靠性和成本之间的最佳平衡。这种平衡可能会在工作流的每一步中发生变化。

GPT‑5.6 为企业提供了更大的空间来优化这一等式。Luna 的性能与一年前的顶尖模型相当,但每个任务的成本仅约为其 6%,速度接近九倍。在专业工作方面,根据 Agents' Last Exam 的衡量,Luna 的表现优于 Fable 5,而每个任务的估计成本低近 99%。

在实践中,企业可以定义所需的结果和质量标准,然后通过评估来确定哪些情况下额外的智能能显著改善结果,哪些情况下更快、更低成本的处理也能达到相同的质量。例如,在一个编码工作流中,可以使用 Sol 来消除不确定性并制定计划,然后使用 Luna 来实施明确指定的更改、编写并运行测试以及评估结果。另一个工作流可能需要不同的平衡。

GPT‑5.6 系列扩展了这些选择的范围。企业可以在每个阶段应用最大有用的智能,同时为其创造的价值支付恰当的价格。

实现这种灵活性,首先需要让模型背后的每一层都更加高效。

我们如何推进效率前沿

How we advance the efficiency frontier

我们的效率优势来源于改进模型、运行模型的推理系统,以及将模型与工具和上下文连接的智能体框架。GPT‑5.6 模型通过工作时路径更直接。更好的路由让硬件保持高效运转,优化的生产软件更高效地生成 Token,更智能的上下文管理帮助智能体避免重复已完成的工作。这些改进共同让我们在相同计算资源下完成更多有用工作,减少了每个结果所需的时间、Token 和成本。

GPT‑5.6 Sol 正在日益帮助我们找到并交付下一轮收益。在人工主导的流程中,Sol 自主地重写并优化了生产内核,设计并运行了数百个实验以改进 Token 生成,并在训练过程中进行监控,在出现问题时进行干预。内核工作帮助将模型服务的端到端成本降低了 20%,而其实验将 Token 生成效率提高了 15% 以上。这项工作还在继续,形成了更紧密的反馈循环:随着模型能力的提升和自主工作能力的增强,我们改进效率的能力也在加速。了解更多⁠关于 GPT‑5.6 背后的工程细节。

为规模而建的计算策略

A compute strategy built for scale

满足对丰富智能的需求需要更多的算力,也需要更高效的算力。我们正在构建一个弹性的基础设施组合,并将每个工作负载匹配到最适合运行它的系统。这种方法同时支持性价比曲线的两端。在低成本端,新的 Luna 和 Terra 价格使得高容量工作以更大规模实现经济性成为可能。在前沿端,快速模式让 API 客户在响应时间重要时更快地访问 Sol。

企业可以将更多 AI 引入日常运营,而无需在最关键的工作上牺牲速度。大规模文档分析、客户互动分类和例行实施可以经济地广泛运行,而复杂的 Sol 工作负载在溢价合理时也能更快执行。

这些收益可以叠加。在人工主导的流程中,更强大的模型帮助我们的技术团队找到下一代的改进方向,缩短了向更好性能和更低成本迈进的道路。我们的战略仍然专注于同时提升能力和效率,使每一代智能都能以更低的成本完成更多工作。

可用性与定价

Availability and pricing

GPT‑5.6 Terra 和 Luna 仍在 ChatGPT Work、Codex 和 OpenAI API 中可用。在 ChatGPT Work 和 Codex 中,Free 和 Go 用户可以使用 Terra,而 Plus、Pro、Business 和 Enterprise 用户可以选择 Terra 和 Luna。

自 2026 年 7 月 30 日起,API 定价为:Terra 每百万输入 Token 2 美元,每百万输出 Token 12 美元;Luna 每百万输入 Token 0.20 美元,每百万输出 Token 1.20 美元。Sol 定价不变。ChatGPT 和 Codex 的订阅价格及配额预算不变,而 Terra 和 Luna 的用量现在消耗更少的积分。定价变更将于今天晚些时候开始在 AWS 上逐步推出。

GPT‑5.6 Sol 的快速模式取代了 API 中的优先处理,并与 Codex 中的 /fast 保持一致。现有标记为 priority 的 API 请求将继续工作。查看完整的 API 定价详情。⁠

  • 2026