走出WAIC,AI的下一场硬仗在吉瓦级AIDC

8 小时前6.4k
AI的竞争,已经从算法和模型,逐渐延伸到了全栈级的算力基础设施的底层。

1.jpg

AI的竞争,已经从算法和模型,逐渐延伸到了全栈级的算力基础设施的底层。

文|白   鸽

编|王一粟

今年的WAIC结束了,展馆里的声浪似乎还在回响。

和往年一样,大模型和机器人依旧是最热闹的阵地,观众排队体验多模态对话、围观机器人递水跳舞,社交媒体上的打卡照片大多出自那里。

但如果拐进旁边的算力基础设施馆,却俨然有着不同的氛围。围观的人群并不少,但相比较各种花里胡哨的交互,这里的严肃感和技术密度反而更高。

百度、华为、摩尔线程等企业把数据中心的“微缩版”搬进了展馆:一排排黑色机柜、密密麻麻的线缆、嗡嗡作响的液冷系统、超节点架构的实物展示等等。

而这些沉默的“钢铁巨物”,或许才是今年WAIC真正值得盯住的暗流。

因为它们正指向一个被大多数人忽略却决定产业生死的问题:如果它们真的在产业里跑起来,需要多少电?怎么冷却?多少网络?多少储能?多少工程交付?

而这也正是7月17日下午,在WAIC人工智能与能源双向赋能论坛上,百度集团副总裁侯震宇和南方电网、中核、中石油、金风、华为、复旦等专家学者坐在一起聊的核心。

2.jpg

(百度集团副总裁侯震宇)

这场论坛像一道冷峻的转场,把WAIC表面的热闹和AI产业真正要打的硬仗,一下子连了起来。

侯震宇点出了本质:“算力的尽头是电力。”新时代的AIDC,不再是传统IDC的简单扩容,而是AI Infra与能源系统深度协同的新型基础设施。

显然,进入吉瓦(GW)时代后,有卡就行的逻辑失效,而算力竞争已从堆卡的军备竞赛,转向每度电产出多少智能的效率比拼,没有底层基建系统性优化,再先进的芯片也只是耗电的摆设。

而这套逻辑,百度在两个月前就已经明确表态。今年5月,百度执行副总裁,百度智能云总裁沈抖在2026百度Create大会上提出了AI Infra的建设目标:“在AI Infra上,百度将提供每瓦性能更强、性价比更高的AI算力,让每一次训练和推理,都转化成更好的智能体效果。”

可以看到,展厅里的那些机柜不会说话,但它们正在无声地诉说一个被大多数人忽略的真相:AI的竞争,已经从算法和模型,逐渐延伸到了全栈级的算力基础设施的底层。

吉瓦级AIDC 算电协同是根本

今年逛完WAIC后,其实可以很明显的感受到,AI算力赛道的风向变了。

过往大家会更看重单芯片能力,潜台词更多是AI的竞争=模型的竞争≈芯片的竞争,只要卡够多、模型够大,就能跑赢。

但今年,行业开始意识到一件事,即芯片或服务器只是AI基础设施的一部分。真正进入产业后,芯片和服务器要放进数据中心,和供电、制冷、网络、储能、调度、运维一起工作。

AI的算力基础设施竞争,不是把服务器摆出来,而是要满足AI的大规模训练推理需求、要稳定、要安全可控,而这需要的是一整套基建能力。

美国银行的一份下一代AI数据中心的成本分析说得很直白:AI数据中心的钱,不是只花在GPU上,而是分布在IT设备、供电设备、冷却设备和工程建设里。

这说明AIDC(AI Data Center,智能数据中心)从来不是单一硬件采购,而是一整套基础设施工程。而这套系统级算力基建,随着规模不断扩大,已经开始进入吉瓦级时代。

吉瓦(GW)是什么概念?简单的说,它就是一个功率的单位,衡量具体的用电量。1GW的用电规模,差不多是一座特大城市的居民用电总量。

3.png

业内都知道,训练一个大模型、运行一个推理集群,本质上是在驱动数以万计的GPU/AI芯片持续高负荷运转。而这些芯片功率密度极高,导致数据中心的耗电量惊人。

用个比喻来说,如果说算力(FLOPS)是“脑力”,那么电力(GW)就是“饭量”。

越聪明的脑子,吃得越多。当一群“超级大脑”聚在一起(万卡/百万卡集群),它们的“饭量”就会从兆瓦(MW)飙升到吉瓦(GW)级别。

这已经不是一个普通变电站能喂饱的,需要专门配套发电设施或接入主干电网。

但从中国电力国情来看,其实并不缺“电”这个原料,缺的更多的是如何把电高效转化为有效算力的系统工程能力。

而这背后所考验的,其实就是“算电协同”能力,就是需要算力和电力同步规划,一起建设、一起运营,不能各干各的。

这也就意味着,做算力基建的企业,不仅要懂芯片和算法,还得懂电网、储能、光伏、液冷,甚至地方能源政策。

今年3月的《政府工作报告》中,明确提出:“打造智能经济新形态,实施超大规模智算集群、算电协同等新基建工程,加强全国一体化算力监测调度,支持公共云发展。”

这是“算电协同”首次被写入政府工作报告,标志着其从地方试点、行业概念正式升格为国家级新基建战略。随后的5月,《关于促进人工智能与能源双向赋能的行动方案》的发布,则将算电协同从政策定调推进到落地实施阶段。

如果没有系统级规划算力基建的云厂商,在下半场的AI竞争中,会比较难受。

就像侯震宇提到的,算力的尽头是电力,双向赋能必须从底层基础设施的重构开始。而百度智能云也从两方面入手,打造系统级的AI算力基建能力。

4.png

简单来说,百度AIDC的核心打法就两条:

第一条,“让AI来管电”,把大模型塞进数据中心的能源管理系统里,相当于给数据中心配了个智能管家。这个管家能毫秒级地感知哪里热、哪里耗电,自动调节空调和供电,把电用到刀刃上。

第二条,“用全栈AI云省电”,靠自研的昆仑芯万卡集群和整套AI云平台,从根子上把算力的“饭量”降下来。同样干一个活,别人的机器吃十碗饭,百度可能只需要吃八碗。AI越往后发展,电费账单越吓人,这条路走通了,长期运营成本就能压下来一大截。

“这样不仅能解决我们数据中心的能源问题,还能够让我们的AI能力进一步深入到能源行业中去。从IT到电力双向运营,从底层基础设施上共同做出东西来。”侯震宇说道。这样,才能真正推动算电协同的实质性落地。

AIDC的新尺子 每瓦多少Token

一般来说,传统IDC建设的逻辑,是堆面积、堆机柜、堆服务器,算力自然就会增长。这套逻辑在CPU时代是成立的,因为负载稳定、功率密度低,且系统复杂度有限。

但AI时代,这一切都发生了变化。

AIDC如果按照此思路进行建设,堆GPU会导致耗电量暴增、散热崩溃,最终名义上算力是增高的,但实际Token产出却很低。

背后的核心矛盾就在于,AI负载与传统云计算存在根本区别:大模型训练、推理、智能体调用会带来更高的功率密度、更复杂的网络通信和更强的调度需求。

举例来说,一般AI负载的功率密度已达100kW以上每机柜,远超传统风冷极限的30到40kW。单纯放大不是建设数据中心,而是热力学灾难。

所以,AI时代,好的AIDC不是更大的“用电大户”,而是能把每一度电尽可能转化为有效AI产出的智能节点。

长期以来,PUE一直是衡量数据中心能效的核心指标之一。它是数据中心总能耗与IT设备能耗之比,数值越接近1,说明用于制冷、供配电等辅助设施的能源占比越低,更多电力真正进入了服务器。

进入AI时代,PUE的重要性并没有下降,反而变得更加突出。大模型训练、推理和智能体调用持续推高算力需求,而数据中心能够获得的总供电容量往往存在上限。此时,每减少一部分制冷和供配电损耗,就意味着可以为GPU释放出更多功率空间。

但PUE只能回答“有多少电进入了IT设备”,还不能回答这些电最终产出了多少有效智能。因此,百度提出,衡量它先进性的标尺,关键还要看每瓦能跑出多少Token。

5.png

那么,数据中心的能耗与Token效率之间怎么转化?

PUE与Token产出之间,存在一层直接的功率转换关系。在同等条件下,PUE降低10%,最终输出的Tokens能增加11.1%。

换句话说,在传统数据中心里,降低PUE主要是一笔节能账;AIDC里,它同时也是一笔产能账。

为了实现每度电更多Token产出,全球巨头们也在为了电力、冷却、选址去重构基础设施布局。

如微软签约三里岛核电站20年,是为了锁定基荷电源保障Token连续产出。xAI在孟菲斯建20万卡全液冷集群,说明散热决定能不能装、能不能跑满。Meta在北极圈建数据中心,因为自然冷却等于免费释放热边界。中国推东数西算,训练去西部、推理留东部,因为能源成本直接决定Token成本。

而一旦“每瓦Token”成为核心指标,所有技术动作都有了统一的标尺。也正是在这个标尺上,百度智能云围绕“每瓦Token产出”,形成了一套贯穿AIDC建设与运行的系统方案。

比如在供电层,百度自研瀚海800V直流电源,将端到端电力传输效率从传统的80%-85%提升至90%,在GW级体量下相当于节省一座中型电站。

储能的角色也在改变。传统数据中心的电池主要用于断电备份,是一种低频应急资产;但在吉瓦级AIDC中,GPU负载可能在毫秒级剧烈波动,需要储能高频参与功率调节。当前,行业正在探索“储备一体”,即在保障备电安全的同时承担一定的削峰填谷功能,百度智能云也在推进相关研究。

另外,制冷层则采用风液兼容架构,可满足未来单机柜600kW+超高功率密度制冷需求,同时兼容风冷与液冷服务器部署,灵活应对芯片供应链不确定性,实现数据中心向液冷架构的平滑演进。

网络层,则以“网络向心布局”替代传统供配电中心布局,最大限度缩短计算节点与网络节点的距离,提升集群算力利用率;交付层则通过工厂预制化与现场并行施工,实现3.2万卡集群4个月极速交付。

这套系统级的全栈能力,构成了百度在AI算力基础设施领域的核心竞争力,不仅有卡,更能将每一度电高效转化为有效算力。

AI云的全栈协同 最贵也最难

吉瓦级AIDC时代,对系统级能力的考验来到了一个新高度。 

想要做好算电协同,要跨部门、跨行业、跨市场的系统协同。它也不是一日之功,需要在真实项目里把电力、网络、散热、调度磨合出来,这对于任何一个云厂商来说,都是巨大的挑战。

这也是为什么,今天能拿出吉瓦级AIDC建设能力和三万卡国产集群交付记录的厂商,值得被认真对待:它证明的不是“我有资源”,而是“我把系统真的跑通了”。

百度智能云,就是目前国内云厂商中首个把这套系统跑通了的玩家。放眼整个行业,他们最先意识到这件事的重要性,并提出了系统性的解决方案,并率先在这个方向做出了突破。

就像前文所说,百度智能云从供电、制冷、储能、网络、交付等多个层面,已经完成了从传统IDC向新时代吉瓦级AIDC的变革。

在这个体系里,百度自研的昆仑芯P800完成规模化交付并直接用于训练文心5.1重要版本的训练,超节点产品天池256超节点相比上一代,吞吐性能提升了25%。

6.png

单点的算力再强,也需要整体的集群优化,同样的GPU功率,如果网络拓扑设计得好,数万乃至数十万张芯片间的通信延迟低,GPU就不会“空等”。

围绕这一瓶颈,百度智能云将集群网络由单口400G接入升级为双口400G冗余接入,并通过多平面架构增强故障容错能力;同时采用全二层组网方案,将端到端时延优化50%。升级后的高性能网络HPN 5.0架构,可以支撑从数十万卡向百万卡规模演进,让更多芯片能够在同一集群中高效协同,减少算力因通信等待而产生的损耗。

同时,如果模型并行策略优化得好,大规模集群的扩展效率就高;如果推理做了量化压缩、投机解码,单次请求的算力消耗就更少。

于是在数据中心之上,百度智能云全面升级了面向大规模智能体应用的新一代全栈AI云,AI Infra与Agent Infra两层同步提速。

未来AI产业的大部分算力消耗,将来自推理和智能体调用。在推理层面,百度百舸AI计算平台通过分层池化架构将KV Cache命中率提升至90%以上,搭配AFD分离、PD分离等深度优化,长链路Agent推理性能较主流开源引擎提升3倍。

可以看到,从底层的国产算力芯片昆仑芯,到吉瓦级AIDC建设的全自研、全优化,再到云平台的百度百舸、百度千帆,以及最终落到AI应用层的百度搭子等智能体产品,百度智能云已经实现了从芯片到云平台,再到AI应用端到端打通。

这几条线拼起来,对应的不是某一个产品,而是从芯、云、模、体的全栈AI云架构出发,打造AIDC的系统级全栈AI算力建设能力——它懂AI负载(自己跑大模型、跑搜索、跑智能体),也有云入口,还能把供电/制冷/网络/储能/调度这一整盘和AI负载一起设计。这种贯穿全栈的协同,也将直接影响AI长期运行的能源效率和成本。

显然,这是“拼装型”云厂商做不到的。

7.jpg

相关数据显示,在中国自研GPU云市场,百度智能云以40.4%的市场份额位居第一,在算力规模、产品能力和重点行业落地方面形成明显领先优势。财报数据更加清晰,今年第一季度,百度智能云AI云收入同比增长79%;其中GPU云收入同比增长184%,增速持续攀升。

而这,也是众多行业客户为百度智能云买单的关键原因之一。2026年上半年,百度智能云AI云中标金额14亿元、位居第一。在统计的五家主要厂商中占比超60%,断层领先。据IDC数据显示,百度智能云以29.55%的市场份额位居第一,持续领跑中国具身智能云市场。

百度智能云的客户覆盖中国联通、中国银联、中汽创智等头部机构,集中在金融、通信、大交通、具身智能等商业化门槛最高、对供应商要求最严苛的行业。

走出WAIC展馆,热闹终会散去。但AI产业真正要回答的问题,不会因为展会结束而消失。

当大模型参数从千亿走向万亿,当智能体从实验室走向千行百业,当AI应用从“能用”走向“好用”,支撑这一切的,不是某一块更强的芯片,而是能把电力、算力、网络、制冷、储能和调度协同起来的新型AIDC。

这个转变,正在重新定义AI基础设施的竞争格局。WAIC上,机器人跳舞很精彩,但别忘了,它们背后那座看不见的新时代的吉瓦级AIDC,才是决定AI能走多远的真正战场。


格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。

App内直接打开
商务、渠道、广告合作/招聘立即咨询

相关文章

详解本轮日元贬值:这次不一样

中国金融四十人论坛 · 昨天 21:11

cover_pic

上游氧化钇出口受限:氧化锆粉体供应格局梳理

伏白的 交易笔记 · 昨天 21:09

cover_pic

全球股市的风暴点:韩国股市的去杠杆已基本完成

哥吉拉 · 昨天 20:16

cover_pic
我也说两句