AI 基础设施

AI基础设施的真正瓶颈:数据交付而非GPU算力

随着企业AI从实验转向生产,GPU并非唯一瓶颈。数据交付效率正成为决定AI投资回报的关键因素,企业需要重新审视存储与计算之间的基础设施架构。

行业背景

企业AI正从实验阶段迈入运营化阶段。过去18个月,企业竞相采购GPU、部署大语言模型(LLM)并构建AI工具链。但根据IDC 2025年Spotlight报告,组织正从一次性AI部署转向可重复、可扩展的生产架构。随着AI嵌入业务核心,性能、安全、可靠性和运营一致性变得与模型创新同等重要。

然而,许多AI项目的实际表现并不理想。技术决策者往往归咎于算力不足,于是追加GPU、扩大集群或更换更强模型。但基础设施团队发现,问题常出现在数据层面:昂贵的GPU并非缺算力,而是缺数据。

市场影响

GPU闲置成本极高。据Uptime Institute 2025年年度宕机分析,超过半数企业最近一次重大宕机成本超过10万美元,五分之一超过100万美元。当数据管道堵塞时,GPU利用率骤降,直接吞噬AI投资回报。

F5产品营销高级副总裁Nirav Shah将现代AI基础设施比作冰山:水面之上是可见的LLM、AI应用、编排框架和GPU集群(约占10%);水面之下则是决定投资能否产生实际价值的存储、网络、流量管理、安全控制和数据移动系统(占90%)。企业过度聚焦冰山一角,而忽略了真正的瓶颈所在。

竞争格局

这一认知转变正在重塑AI基础设施市场。传统GPU供应商(如NVIDIA)仍为核心受益方,但数据交付解决方案提供商——如F5、NetApp、Pure Storage等——正获得新增长机会。应用交付控制器(ADC)正在演变为应用交付与安全平台(ADSP),将流量工程、安全控制和可视化整合为一体。

相比之下,仅依赖直接存储访问的架构面临挑战。紧密耦合的设计在AI规模下暴露出性能脆弱性:延迟峰值、吞吐堵塞和流量激增对传统应用影响不大,却会成倍放大AI性能问题。

企业启示

企业应重新审视基础设施的“吃水线以下”部分。首先,从紧密耦合转向松耦合架构:在存储与计算之间插入智能控制层(如ADC),处理TLS终止、证书管理、流量优化和策略执行,释放存储系统的CPU资源,使其专注数据服务。

  • 其次,从三个维度构建弹性:
  • 可及性:确保AI工作负载始终能访问健康存储资源,故障时可自动切换。
  • 策略:防范“惊群效应”、重试风暴等流量异常,通过智能控制层整形流量并维持安全态势。
  • 交付:隔离客户端与存储节点的维护变更,保持数据流不中断。

案例:某全球大型金融服务机构通过部署专用物理ADC,实现对象创建、读取、删除操作性能提升5倍以上,删除延迟改善一个数量级,且无性能回归。

未来展望

未来12-24个月,AI基础设施投资将从GPU集群扩张转向数据管道优化。企业将更关注“数据交付层”的投资回报率,促使ADC向ADSP演进。24-36个月内,大多数大型企业将采用松耦合架构,数据交付将成为AI运营的关键竞争力。投资者应关注提供数据交付、安全保护和智能流量管理的基础设施厂商,而非仅聚焦算力提供商。

文章语境 · aiindustryreview

aiindustryreview 将这段说明放在「AI 模型 / 跟踪前沿模型发布、基准表现、安全评估、开放权重模型、多模态系统,以及买方真正关心的能力变化。 / 模型发布与能力声明」的站点语境中。「AI 模型 / 跟踪前沿模型发布、基准表现、安全评估、开放权重模型、多模态系统,以及买方真正关心的能力变化。 / 模型发布与能力声明」解释了本文的本地编辑角度;日期、名称和状态变化仍需重新核对。读者复用摘要前应先打开来源链接。

来源链接

  1. https://techcrunch.com/sponsor/f5/your-gpus-arent-the-problem-ais-real-bottleneck-is-data-delivery/主要

相关文章

返回频道