在全球范围内提供咨询的企业中(涵盖金融服务、医疗保健、零售和公共部门),领导层会议上无一例外都会出现相同的危机。高管们批准了宏伟的AI路线图,云支出攀升了40%、50%甚至70%,然而,那些在董事会汇报中看起来完美无瑕的AI工作负载,在触达真实用户之前,要么陷入停滞、要么预算超支,要么在生产环境的负载下走向崩溃。我写下这些文字时,2026年春季的会议季刚刚结束。从Google Cloud Next、微软 Build以及一系列AWS峰会传来的信号,让这一问题变得更加尖锐。在过去几周里,整个行业已经交付了用于大规模运行和治理AI的生产级基础设施,而大多数企业依然缺乏的,是决定如何使用它的运营模型。
问题不在于AI模型本身,模型完全可以正常工作,问题在于,企业是基于过时的云战略来构建其AI雄心的,而这些战略是为那个早已不复存在的旧世界设计的——那是专为SaaS应用、可预测的流量和线性成本曲线量身定制的战略,而AI工作负载同时打破了这三个假设。
为什么AI打破了传统的云假设
十年来,“云优先”策略让企业受益匪浅,它带来了弹性、降低了资本支出,并实现了算力资源的普惠,因为当时的企业工作负载是可预测的:Web应用、ERP系统、数据库和分析流水线,这些业务扩展平稳,其计费方式也是财务部门可以在电子表格上轻松建模的,但生成式AI和自主式AI一举颠覆了所有这些假设。
当企业将AI投入生产环境,涉及真正的推理、检索流水线、向量搜索和实时决策时,云的方程式在以下至少五个维度上发生了断裂:
• 训练集群所需的功率密度远超标准算力。
• 推理需要毫秒级的延迟,而网络地理位置往往会成为瓶颈。
• 向量数据库会产生在标准账单中隐形的气泡式成本。
• 智能体工作负载会串联起数百个工具调用,产生级联依赖。
• 数据主权法规限制了这些工作负载的运行地点。
简而言之,在平台层面行得通的方案,在工作负载层面失效了。
成本是让领导者们感到震惊的第一件事,因为它们极具隐蔽性。CloudZero的分析以及与我合作的FinOps团队说得非常直白:AI支出在账单上通常表现为通用的算力、存储和实例条目,极少被标记为“AI”。以下三个层面制造了绝大部分的浪费:
• 最显性的是LLM API成本:由于无状态调用在每次请求时都会重新发送完整的对话历史,一个仅有数百名用户的部署项目,其实际消耗的Token预算可能比商业案例中预计的高出数倍。
• 最大宗的是闲置GPU:团队往往按照峰值需求来配置资源,结果实际利用率只有10%到20%,导致大多数企业对AI成本的预测偏差超过一个季度。
• 最被低估的是向量数据库和检索层:其存储I/O、查询量和嵌入刷新费用在账单寄到之前,绝对不会出现任何“AI”字样的标签。
领导者低估的两个维度:韧性与控制
成本和延迟占据了讨论的核心,然而,有两个维度在某些环节彻底崩溃之前,很少能获得同等程度的重视:
• 韧性:依赖AI的系统能否在故障中幸存、实现优雅降级并可预测地恢复。
• 控制:谁能对其进行观测、中止和审计。
AI引入了传统架构从未遇到过的故障模式:在关系到营收的关键推理中,GPU成为单点故障源;智能体流水线在执行途中失败且无法回滚;以及模型由于漂移或限流而发生隐性降级。
我看到这种模式在各行各业不断复制,企业按照传统应用的标准来设计韧性,然后直接在上面部署AI,却从不询问同样的保障是否依然成立。在我提供咨询的一家全球金融服务公司中,一个在单一云区域运行的实时信贷决策模型在一次区域可用性事件中中断了47分钟。停滞的贷款审批所带来的损失超过了该系统全年的基础设施预算,而随后进行的韧性重构成本,更是从一开始就进行良好设计的数倍。想要避免这一情况的领导者,在系统上线前必须提出四个问题:
• 当网络发生故障时会发生什么?
• 当模型发生降级时会发生什么?
• 当智能体只执行到一半时会发生什么?
• 谁拥有中止和审计的最高权限?
今年春季云厂商释放了什么信号
主流云厂商在2026年对AI基础设施的投入预计将接近7000亿美元,大约是2024年水平的3.5倍,他们的发布内容是战略信号,而不仅仅是功能更新。去年,他们收敛到了同一个核心信息上:企业不可能把所有东西都运行在公有云中,因此三大厂商都构建了将基础设施引入用户数据中心和主权环境的方法。今年,这一信号又向前迈进了一步。他们不再讨论工作负载在哪里运行,而是开始交付用于治理智能体行为权限的控制层:涵盖身份认证、隔离封闭、可审计性以及回滚机制。
微软推出了带有执行容器和智能体机器身份的“Agent Computer”模型,AWS围绕运行期、内存、身份和可审计性构建了Amazon Bedrock AgentCore,Google则交付了智能体网关以及用于跨云流量的主权控制。正如Bain所观察到的,自主式AI现在是一个经济学和运营问题,而不仅仅是能力问题。微软自己提出的核心逻辑一针见血地指出了这一点:单靠AI不会改变你的业务,运行AI的系统才会。McKinsey的解读也高度一致:工作负载正在变得更加分布式、专业化且对运营提出更高要求,这迫使企业必须做出更深思熟虑的基础设施决策。
从平台选择到部署位置决策
我记录到最频繁的失败并不是技术失败,而是治理失败。大多数企业缺乏一种清晰、可复制的方法来决定什么工作负载运行在什么地方、在什么条件下运行以及需要做出什么权衡。平台团队往往在截止日期的压力下非正式地做出决定,并在新场景上线时重复这一过程数百次。这导致工作负载默认(而不是有设计地)向公有云堆积,随之而来的是30%到50%的成本超支——这并不是因为公有云是错误的战略选择,而是因为企业压根就没有做过深思熟虑的选择。
在我提供咨询的一家全球制造企业中,一个预测性维护模型在公有云上线,其表现与在预发环境验证的完全一致,然而,工厂端的实时推理在广域网(WAN)上运行的延迟达到了80到120毫秒,而机器控制系统要求的延迟必须在10毫秒以下。将模型移动到边缘节点解决了延迟问题,但该公司损失了接近一个季度的成本、重构开销并推迟了效益变现,同时生产线在过时的建议下运行了数周:这是一次险些酿成安全事故的控制失效。解决方案绝不是雇佣更多的AI人才,而是在一开始就建立一个结构化的部署位置决策机制,全面权衡以下六个维度:
• 延迟:实时(10毫秒以下,边缘或本地)、交互式(50到500毫秒,云端)或批处理。
• 成本与TCO:Token消耗、GPU利用率、向量数据库查询、数据出云以及每个工作负载的单元经济效益。
• 韧性:故障转移架构、降级模式表现、恢复SLA和回滚策略。
• 控制 :可观测性、审计追踪、治理权限以及中止或撤销的能力。
• 数据敏感性:主权要求、隐私与合规条例,以及知识产权(IP)保护。
• 集成 :遗留系统依赖关系、流水线复杂度以及数据驻留限制。
这已经不再是可选项,Cloudian的2026年企业AI基础设施调查发现,79%的企业已经将AI工作负载迁出公有云,93%的企业正在将回迁或积极评估这一方案,其核心驱动力是数据主权、成本超支和实时性能。云回迁现在是常态,而不是例外。
智能体层的出现让这种纪律性变得迫在眉睫,一个智能体会串联20到100个工具调用,每个调用都有自己的延迟、成本和故障模式,因此适用于聊天机器人的治理模型根本无法适用于处理采购审批或客户入职的自主智能体。今年春季,云厂商正是针对这一点交付了生产级基础设施,然而Deloitte在2026年对3000多名领导者的调查中发现,只有大约五分之一的公司拥有成熟的自主智能体治理模型。平台已经解决了技术机制,但大多数企业还没有制定出相应的政策。
领先的领导者有何不同
那些从AI中获取复合价值(而不仅仅是搞技术试验)的企业,都恪守着一个共同的纪律:他们将工作负载的部署位置决策视为一个可复制的流程,并且从一开始就将韧性和控制构建进去,而不是等到第一起生产环境事故发生后才去补救。在实践中,他们会做五件事:
• 在配置任何基础设施之前,在准入阶段就对照六个维度对每个使用场景进行分类。
• 将实验、生产推理和训练的AI预算条目切分,确保成本可治理。
• 将单元经济效益(单次推理成本、单次查询成本和单次智能体运行成本)视为工程师的KPI,而不是月底对账时的“惊吓”。
• 提前定义云回迁触发点,通常为12到18个月的稳定业务量。
• 在规模化扩展之前,制定明确的韧性契约,以及智能体可观测性和回滚规则。
“战略就绪”与“基础设施就绪”之间的差距就是补救债务的积压,大多数企业在从概念验证迈向生产环境时停滞不前,恰恰就是这个原因。Deloitte的技术趋势分析将这种转变定义为向推理经济学的迈进:瓶颈在于基础设施的治理,而不是模型的性能。
对于CIO而言,以下是一个90天的行动议程,这五项行动将行业领跑者与那些疲于应对基础设施危机的管理者区分开来:
• 对照延迟、成本、主权、业务量、韧性、控制和集成,审计生产环境中的每一个AI工作负载。
• 拆分AI基础设施预算条目,使每种工作负载类型都可归因、可治理。
• 按工作负载定义单元经济效益,并将其作为工程KPI进行审查。
• 设定量化的云回迁评估触发点。
• 在规模化扩展智能体之前,定义好可观测性、成本归因和回滚策略。
战略层面的重新定义
那些在AI领域取得真正进展的企业,其优势并不在于模型的先进程度或云合同的规模大小,真正让他们脱颖而出的是一种纪律:一种清晰、可复制的方法,用来决定什么工作负载在哪里运行、在什么条件下运行、需要做出什么权衡,以及当发生故障时该怎么办,这种纪律不再是一个单纯的IT问题,它是一种战略能力,需要CIO的执掌、CFO的对齐以及高管层的问责制。
今年春季,云厂商已经把用于运行和治理AI及智能体的基础设施交到了企业手中,覆盖了架构的每一个层级。瓶颈不再是供应端,而是企业是否拥有去有意识使用的运营模型。现在构建这一模型的企业,正在为规模化AI奠定运营基石;而其他所有人,则在不断堆积补救债务。你在未来12个月内做出的基础设施决策,将决定你最终成为这两者中的哪一个。


