📖 精译自原文 · 已获取报告全文(5 段)按章节忠实精译;数字与原文逐字一致
在最近一次面向某科技服务公司的技术领导层会议上,一个团队热情地批准了一项新的AI能力。当讨论转向实施时,一位高管问了一个简单的问题:“这要花多少钱?”
会议室里一片沉默。没人知道答案。
这种缺乏透明度的情况并不罕见,并且正成为企业AI领域最具定义性的风险之一。在各行各业,组织都发现AI成本的飙升速度远超传统技术支出。在某些案例中,公司仅在数月内就耗尽了全年的AI预算,被迫进行紧急合同重新谈判并提交意外的资金申请。
这些支出中有很大一部分仍处于隐形状态。业务部门独立采购AI能力。员工在中央IT部门之外构建AI驱动的工作流。公民开发者(citizen developers)和“氛围编码者(vibe coders)”可能在无意中创建出每天消耗数百万个token(令牌)的自主智能体(autonomous agents)或应用程序。
根据麦肯锡的一项调研,当组织从孤立的用例转向企业级全面采用时,AI支出几乎增长四倍。¹ 尽管62%的组织已从实验阶段进入AI的积极部署阶段,但93%的受访者报告称其AI预算已超支(图表1)。²
这一问题预计将变得更加严峻,我们调研中的大多数公司预计其AI支出在未来12个月内将至少增长25%。³ 许多组织意识到,它们缺乏管理这笔支出所需的可见性和控制手段。“Token最大化(Tokenmaxxing)”正成为一个负面词汇,一些公司已撤下其AI用户排行榜。过去两年驱动AI发展的“冲冲冲”能量,正让位于一个“稍等一下”的时刻。
虽然一些公司可能倾向于暂停其AI项目,但深思熟虑的首席信息官(CIO)们正寻求通过掌握企业AI代币经济学(tokenomics)这一新兴领域来规模化AI并管控需求(见边栏“什么是代币经济学?”)。可以将其视为AI领域的FinOps(云财务运营)——一种主动且持续地预测和管理AI模型使用情况以最大化投资回报率(ROI)的方式。
什么是代币经济学(What is tokenomics)?
代币经济学(Tokenomics)的范围超越了提示(prompt)和推理(inference)成本。它涵盖了AI消费的更广泛经济学:模型选择、路由决策、编排模式、智能体行为、工作流设计、基础设施利用率,以及在整个AI赋能流程中消除浪费。
¹ 麦肯锡企业AI FinOps调研,2026年5月;120家企业参与者,75名合格受访者,覆盖五大行业。
² 麦肯锡企业AI FinOps调研,2026年5月;120家企业参与者,75名合格受访者,覆盖五大行业。
³ 麦肯锡企业AI FinOps调研,2026年5月;120家企业参与者,75名合格受访者,覆盖五大行业。
对CIO而言,这是一个塑造技术如何为企业创造经济收益的重要机遇。根据我们的经验,在AI消费方面深思熟虑的公司可以节省20%–30%的AI成本。它们通过培养优化支出、改善问责制以及将节省的资金重新导向最高价值机会的能力来发现这些节省空间。
为何AI成本如此难以管理(Why AI costs are so difficult to manage)
许多CIO会本能地将管理AI支出的挑战与云计算早期阶段相类比。这种比较在某种程度上是有用的,因为许多治理问题相似。但与token、API调用和基础设施使用相关的AI特有议题,为CIO带来了需要管理的一系列全新挑战:
— AI使用模式不可预测。 同一任务可能产生截然不同的token量,调用不同的模型,触发不同的智能体链,并产生显著不同的成本。智能体工作流(Agentic workflows)会成倍增加每次交互的模型调用次数,迅速……
如何管理AI消费
How to manage AI consumption
我们的分析与经验表明,有四项行动可以更好地管理AI需求。
了解AI支出以改进管理与预测(Know what you’re spending on AI to manage and forecast better)
对现成AI能力生态系统的广泛接入导致了AI蔓延(AI sprawl),而其累积成本却缺乏可见性。组织无法优化它们看不见的东西。在许多企业中,AI支出仍然分散在云服务商、基础模型供应商、软件平台、实验环境以及业务部门之间。这使得企业难以掌握全企业范围的消费情况、预测未来需求或理解成本驱动因素。事实上,我们的经验显示,由于AI投资分散在多个供应商、工具和商业模型中,20%–30%的AI支出往往未被计入。
在一家组织中,建立AI支出统一视图的努力揭示了成本分布在企业级Copilot、基础模型合同、AI赋能软件功能、基于API的服务、实验环境以及业务部门采购中。原本看似简单的技术预算工作,已演变成一个分散的AI支出组合,没有任何单一可信源(single source of truth)。
这种透明度的缺失通常意味着,成本超支往往只有在消费已经发生后才会显现。此外,它还阻碍了可靠预测的建立——考虑到AI智能体(AI agents)的非确定性本质,这尤其具有挑战性。在执行同一任务时,令牌(token)用量可能相差高达30倍。⁴
⁴ Longju Bai et al., “How do AI agents spend your money? Analyzing and predicting token consumption in agentic coding tasks,” Stanford Digital Economy Lab, April 14, 2026; Matty Smith, “How are AI agents spending your tokens?,” Stanford Digital Economy Lab, May 5, 2026.
随着组织从Copilot转向智能体工作流(agentic workflows),CIO将越来越需要能够建模多种场景的需求预测,包括采用增长、工作流扩展、路由变更以及前沿模型与开放权重模型(open-weight models)之间的切换。事实上,预测成熟度高的组织在AI支出上平均比同行节省10%。⁵
满足这一需求需要强大的AI FinOps能力。然而,迄今为止,只有20%–25%的企业拥有成熟的AI FinOps实践(图表2)。
当CIO为AI构建FinOps能力时,他们需要优先建立一个集中的AI控制平面(AI control plane),为支出、使用情况、性能以及业务成果提供单一可信源,作为情景规划的重要洞察来源(参见边栏“什么是AI控制平面?”)。
这种透明度通过回显(showback)和计费(chargeback)机制建立问责制,将AI消费直接与产生需求的业务活动挂钩。这一能力至关重要,因为治理的单位应该是完成的业务成果,而非令牌成本。
AI正成为管理支出的强大工具。组织正在将AI用于日益广泛的任务,包括分析消费模式、推荐低成本模型、预测需求、检测低效的提示词设计(prompt designs)、识别不必要的
⁵ McKinsey Enterprise AI FinOps survey, May 2026; 120 enterprise participants, 75 qualified respondents across five major industries.
什么是 AI 控制平面?
What is an AI control plane?
AI 控制平面是一个企业管理层,位于用户、应用、智能体(agents)以及它们所消费的 AI 模型或平台之间。如果说企业资源规划(ERP)系统成为了财务交易的记录系统,那么 AI 控制平面可能将成为智能消费的记录系统。其目的是使 AI 使用在大规模下可观测、可归因、可治理,涵盖三个维度:
可见性与归因(Visibility and attribution)。控制平面捕获跨用户、应用、工作流、模型、提示词(prompts)、智能体、令牌(tokens)、API 调用、延迟和成本的请求级遥测数据。通过将使用情况标记到业务单元、产品、用例、工作流、负责人和成本中心,组织可以从汇总的供应商发票转向有意义的单位经济学,例如每项任务、每个案例、每次代码审查或每次客户互动的成本。
策略与治理(Policy and governance)。控制平面使组织能够实时执行规则,包括批准的模型访问、基于角色的权限、令牌预算、支出阈值、上下文窗口限制、高级模型审批以及异常工作流。这有助于在可避免的支出和未管理的风险发生之前加以预防。
路由与优化(Routing and optimization)。控制平面可以根据成本、质量、延迟、风险和可用性,将工作负载路由到正确的模型或提供商。它还可以识别优化机会,例如缓存、提示词标准化、智能体循环缩减、输出长度控制以及模型合理选型。随着时间的推移,AI 系统将能够持续优化其他 AI 系统。
优化支出
Optimize spend
大多数组织最初将 AI 优化视为一个模型选择问题。但机会远不止于此。最大的节省往往来自优化消费令牌的系统。
AI 成本管理之所以复杂,是因为它可能因模型选择、令牌消耗、路由决策、智能体行为、编排模式以及用户采用情况而剧烈波动。我们的分析显示,约有 40 个杠杆能产生最佳的支出优化效果。例如,提示词缓存(prompt caching,即重用静态提示词上下文)可将重复的输入令牌成本降低高达约 90%,尤其适用于检索增强生成(RAG)和具有大型稳定前缀的智能体。
AI 辅助优化还可以通过推荐更短的提示词、减少不必要的上下文以及标准化提示词模板来提高提示词效率。约三分之一的受访组织已通过主动优化行动实现了 20% 到 30% 的节省(图表 3)。
以下活动对优化 AI 成本影响最大:
- 选择正确的模型类型。很少有任务需要使用昂贵的前沿模型(frontier models)。公司应将每项任务路由到能够提供所需质量的最低成本模型。
- 减少臃肿的令牌输入。缩短提示词,限制上下文窗口,仅传递文档或工具输出的相关部分,并在将长对话历史发送回模型之前进行摘要。重用静态提示词上下文可将重复的输入令牌成本降低高达约 90%,尤其适用于 RAG 和具有大型稳定前缀的智能体。
- 控制输出令牌消耗。定义预期的响应格式,在适当情况下使用结构化输出,并根据用例限制响应长度,使模型不会生成不必要的文本。
- 管理智能体与工作流数量。对重试、工具调用、智能体循环和升级路径设置限制;在上游重新设计重复或结构不良的工作流,而不是简单地“用智能体去解决问题”。
- 批处理与缓存。对延迟要求不高的非紧急、高容量请求进行批处理,并缓存重复的提示词、稳定的上下文以及可重用的中间结果,以避免为相同的推理重复付费。
- 有选择地使用开放权重模型。对于不需要最智能、最昂贵模型的简单任务,考虑使用开放权重模型(open-weight models)作为前沿模型的替代方案(参见边栏“AI 模型深度解析”)。
现代化采购并建立财务问责制
Modernize sourcing and establish financial accountability
传统的软件采购模式建立在可预测的许可结构、年度承诺和按席位定价的基础上。AI 引入了一种不同的现实,其特点是基于消费的定价、快速演变的模型生态系统、波动的需求模式以及持续创新。因此,公司需要新的机制来同时治理 AI 消费和管理提供商及访问权限。
来自麦肯锡调研的领先组织通过两个采购与谈判杠杆,实现了 10% 到 20% 的单位成本降低。第一个是制定 AI 问责模型,该模型能够清晰展示谁在消费 AI 资源、创造了什么价值以及成本是如何在整个组织内产生的。类似于云 FinOps,领先组织越来越多地将 AI 成本——包括令牌使用、API 调用、基础设施消耗和模型费用——分配给产生需求的业务单元、产品或用例。
有效的问责模型将透明的计费或展示机制与自动化的防护栏相结合,以监控使用情况、执行策略并识别低效环节。这有助于组织不再将 AI 支出视为集中的技术成本,而是将其作为与可衡量成果挂钩的业务投资进行管理。
深入审视 AI 模型
A closer look at AI models
企业如今拥有越来越多获取 AI 模型的途径。
专有模型(包括前沿模型)(Proprietary models, including frontier models):这些是最先进的模型。它们在复杂推理、编码、多模态任务和智能体工作流(agentic workflows)方面通常表现最佳。正因如此,它们往往也是最昂贵的模型。企业通常通过 API 或托管云服务访问这些模型,并按用量定价。使用这些模型的智能体(Agents)通常能管理整个工作流。
开放权重模型(Open-weight models):开放权重模型是指其核心能力(即“权重”)公开可用的 AI 系统。它们为企业提供了更大的灵活性,并且通常能为许多用例提供成本更低的替代方案。组织可以通过以下几种部署方式访问开放权重模型:
- 提供商托管(Provider-hosted):这些模型由云服务商或推理提供商托管,使企业无需管理底层基础设施即可访问。代价是,公司仍需依赖外部提供商进行托管、扩展、保障正常运行时间以及部分数据治理工作。
- 企业自托管(Enterprise-hosted):一些组织在自己采购、配置和维护的基础设施上运行开放权重模型。这能对数据、定制化、延迟以及大规模下的单位经济性(unit economics)实现更强的控制,但需要更强的工程、MLOps、安全和基础设施能力。
- 边缘或本地模型(Edge or local models):较小的模型也可以直接在员工设备(如笔记本电脑或手机)上运行。这些模型的能力通常不如前沿模型,但对于风险较低的本地工作(如摘要、低量分类和翻译)很有用。
这种可见性日益重要,因为它有助于识别那些在大规模应用中推高成本的隐藏支出:重复失败的请求重试、大型提示词(prompts)中的内容膨胀、对话历史、智能体链(agentic chains)以及模型泛滥。
第二个杠杆涉及制定一种超越传统“购买与自建”问题的 AI 策略。现成的 AI 解决方案日益丰富,但这并未降低、反而增加了企业 AI 经济学的复杂性。随着组织能够接触到更多模型、副驾驶(copilots)、AI 应用和部署选项,挑战已从获取能力转变为管控在何时、何地以及如何消费这些能力。
正因如此,“购买与自建”的采购问题已不再适用。如今的问题日益演变为如何找到购买、自建、托管、路由和切换的最佳组合。组织必须根据模型性能、成本、风险和业务价值,持续评估每个工作负载所需的模型或架构,从而随时间推移优化其 AI 供应组合(见表)。
将治理直接嵌入架构
Embed governance directly into the architecture
CIO 们面临一个不同寻常的挑战:过去三年,他们一直鼓励员工更多地使用 AI。现在,他们必须鼓励员工更智能地使用 AI。成本管理应成为更广泛的变革管理工作的一部分,而不是指望人们自行学会在 AI 使用中做到成本高效。
解决这一问题的方法之一是将治理和支出管理实践自动化,并直接嵌入 AI 架构。AI 网关(AI gateways)、控制平面(control planes)、策略引擎(policy engines)和自动化护栏(automated guardrails)有助于强制使用经批准的模型、监控消费、自动应用组织策略,并实现负责任的 AI 控制。
例如,麦肯锡内部正在试点的一个工具,会在员工使用大语言模型(LLMs)时指导他们如何编写更好的提示词并审慎选择模型。实践证明,在实际使用产品时进行教育和引导,而非仅要求参加单独的培训,效果显著。
CIO 现在应优先考虑什么
What CIOs should prioritize now
面对这些 AI 成本压力,一个常见的诱惑是直接削减支出。这将是一个错误。更好的方法是专注于塑造需求,为业务创造最大价值。根据我们的经验,最成功的 CIO 会聚焦于以下行动:
-
在成本爆发前建立预测能力。随着 AI 采用范围的扩大,组织需要清晰了解消费发生在何处、成本驱动因素是什么,以及哪些用例正在创造价值。因此,CIO 应投资于预测能力,模拟不同采用率、定价和工作负载场景下的需求。AI 商业案例应包含预计消费曲线、敏感性分析和预期的每产出成本(cost-per-outcome)指标。目标是让 AI 经济学从一项预算编制工作转变为一种规划纪律。
-
转向 AI 业务价值问责模式。CIO 应与财务和业务领导者合作,建立成本归属模型(cost-attribution models),将 AI 使用直接与产生需求的产品、工作流和业务部门挂钩。目标是让哪些用例正在创造价值、哪些在消耗资源变得透明。
表:AI 外包动态与传统采购截然不同
| 传统软件采购 | AI 采购 |
|---|
| 基于席位的许可 | 基于消费的定价 |
| 单一供应商策略 | 多模型生态系统 |
| 固定的需求预测 | 动态需求管理 |
| 长期承诺 | 灵活的商业结构 |
| 定期基准测试 | 持续基准测试 |
将AI投入锚定于企业最具价值的工作流
Anchor AI efforts around the enterprise’s most valuable workflows
CIO应与业务领导者合作,识别AI能够创造不成比例价值的那些工作流——无论是通过生产力提升、收入增长、客户体验改善还是风险降低。这些工作流应成为初期AI消费能力的聚焦点,因为其影响最大,所产生的节省可再投资于其他技术优先事项。
在采购与技术选择中保持灵活性
Maintain flexibility in sourcing and technology choices
鉴于创新的速度,今天的最优模型或供应商六个月后可能不再是最优选择。CIO应避免将组织锁定在僵化的商业结构或狭窄的技术栈中。相反,CIO应与企业架构师合作,设计能够保留灵活性的架构与采购策略。关键要求应包括:支持多个模型供应商,保持在工作负载在专有模型与开放权重模型(open-weight models)之间迁移的能力,并定期重新评估工作负载的部署决策。
在支出达到规模之前建立永久性AI FinOps能力
Build a permanent AI FinOps capability before spending reaches scale
CIO应建立一个跨职能的AI FinOps团队,负责预测需求、监控消费模式、识别优化机会、评估采购选项以及衡量每项成果的成本(cost per outcome)。该团队应作为一项永久性企业能力运作,而非临时项目办公室。正是这个团队的责任,是紧跟快速变化的AI成本动态,并迅速将其整合到FinOps能力之中。
将治理直接嵌入AI运行环境
Embed governance directly into the AI operating environment
随着AI采用规模的扩大,自动化成为大规模治理消费的唯一可行方式。CIO应考虑通过AI网关(AI gateways)、控制平面(control planes)、策略引擎(policy engines)和自动化护栏(automated guardrails),将治理直接嵌入架构中。这些系统可以在适当时将请求路由至成本更低的模型,强制执行预算阈值,限制不必要的上下文扩展,监控智能体行为,并在成本或风险超出预设限制时触发升级。目标是让经济高效的选择成为默认选择。
AI正迅速成为技术支出中规模最大、增长最快的类别之一。但这并非仅仅是另一个成本管理挑战。那些创造最大价值的组织,将发展出预测需求、治理消费并持续优化智能经济性的能力。这将是AI时代CIO面临的决定性挑战。
Pankaj Sachdeva 是麦肯锡费城办公室的高级合伙人;Wasim Lala 是华盛顿特区办公室的合伙人;Avinash Javaji 是纽约办公室的副合伙人;Kaavini Takkar 是西雅图办公室的副合伙人;Purva Arora 是多伦多办公室的知识专家。
作者感谢 Dinky Khatri、Kiran Nagra、Nicolas de la Flor 和 Raghuvar Choppakatla 对本文的贡献。
本文由纽约办公室编辑总监 Barr Seitz 编辑。