
3500亿颗芯片之后,Arm要成为AI时代的“共同语言”
Arm Everywhere China 大会上,三组数字引人瞩目。
第一,全球搭载 Arm 技术的芯片已超过 3500 亿颗;
第二,Arm 首款自研 AGI CPU 芯片,发布仅六周,客户需求就从 10 亿美元翻倍至 20 亿美元;
第三,2025 年物理 AI 市场规模 约 250 亿美元,到 2030 年或将涨至 2000 亿美元,增长空间高达 8 倍。
如果只把这三条业务线当作云计算、边缘计算、物理 AI 三条平行赛道的战报,就低估了 Arm 真正想做的事。
作为移动计算行业的技术底座,Arm 的下一站,一边瞄准蓬勃发展的云计算市场,一边押注方兴未艾的物理 AI。
今年 1 月,Arm 将汽车、机器人聚合为物理 AI 业务线,与「云与 AI」、「边缘计算」并列为三驾马车。
用 Arm 自己的表述:云端,智能得以诞生;边缘,智能更加个性化;物理世界,智能付诸行动。三者由此形成一个高度互联的计算连续体,而 Arm 以生态协同的方式贯穿其间。
一言以蔽之,在给全球芯片定义了一套底层指令后,Arm 现在想做的,是给 AI 时代的智能计算定义一套「共同语言」。
1、Arm 开始给机器人加上一把「标尺」
Arm 面向物理 AI 并没有发布新产品,而是转而做起了「生态联盟」,并发布了机器人能力分级框架。
一个重要前提是,Arm 同样认为,汽车与机器人本就该汇入同一条河流。两者核心计算需求高度相似:都需要一个强大的「大脑」来处理复杂逻辑,一个「AI 加速器」来运行深度学习模型,以及一个「安全岛」来确保关键动作的可靠执行。
去年 6 月,Arm 发布了 Zena 计算子系统(CSS),这是一套专为「AI 定义汽车」设计的、预先打包好的高性能计算平台「乐高套装」。
值得强调的是,过去三年,Arm 已经打破了「卖 IP 图纸」的刻板印象,产品形式升级,把 CPU、互联、安全引擎提前打包、验证、封装,交付一个可直接开发的「半成品」。
这构成了一种双赢状态,客户通过 CSS 缩短开发周期,Arm 则完成了每一代芯片更深的介入。
回到 Zena CSS,它的核心作用正是加速和简化下一代智能汽车核心芯片的开发,比如,在真实芯片制造出来之前,汽车厂商就能利用其虚拟模型提前进行软件开发,实现「软硬并行」,芯片开发周期可缩短最多 12 个月。
这套系统已经广泛应用于汽车行业,如数字座舱领域,而重点是,机器人行业同样适用。
Arm 也注意到,目前行业内鲜有针对机器人的专用芯片解决方案,大部分方案都是从汽车领域复用而来。
那么,顺水推舟,围绕汽车业务建立的生态蛋糕可以直接扩大到物理 AI。
过去,以 Zena CSS 为核心,Arm 已经聚合了 BlackBerry QNX、Elektrobit、Mobileye、NXP、西门子等多家行业巨头。
现在,这一生态盘子以物理 AI 为主轴后,继续扩大到了 80 多家,合作范围涵盖了软件、AI 模型、传感器、计算硬件、虚拟平台和数字孪生等物理 AI 全方面。
生态联盟凝结的目标,在于解决行业痛点。当下机器人行业正处于高度碎片化的状态,从硬件接口、软件框架到 AI 模型部署方式,各家厂商都在各自定义「智能」,缺乏统一的「能力语言」,导致上下游之间的沟通和协同成本极高。
就像自动驾驶行业当年推出 SAE 的 L1-L5,并非刻意发明概念,而是产业链的复杂度已经倒逼出一套共同语言。
机器人行业正在经历同样的阶段。什么是自主、什么是理解上下文、什么才算具身智能,至今没有统一坐标。
Arm 由此发布的机器人能力分级(RL0-RL5),要解决的正是这个问题。它给行业一套可对齐、可比较、可协作的能力对照表。
从固定反应(RL0)逐步演进到自我进化(RL5),能力逐级提升。
- RL0:基础反应型。仅对刺激做出固定反应,无记忆和学习能力。
- RL1:规则执行型。按预设规则执行任务,无自主调整能力。
- RL2:反馈调整型。通过传感器反馈在限定任务内实时调整优化。
- RL3:上下文适应型。能理解上下文和场景语义,具备短期推理能力。
- RL4:目标规划型。具备持久认知能力,能在多目标间权衡并规划行动。
- RL5:自主进化型。具备元学习能力,能自我优化策略并持续进化。
Arm 显然适合干这件事。
首先,Arm 在芯片产业链中处于上游位置,与所有下游厂商都不构成直接竞争关系。
这使得 Arm 天然适合扮演标准制定者和生态组织者的角色,因为它有能力将整个产业的各方力量凝聚到一起,而不必担心利益冲突。
其次,基于 Arm 架构的芯片已在全球超过 3500 亿颗设备中运行,从底层芯片 IP、开发工具到丰富的软件兼容性,Arm 的积累几乎是不可复制的。
更何况,随着 Zena CSS 在汽车领域的成功落地,Arm 已经验证了「计算子系统+生态协作」模式在高性能实时计算场景中的可行性。这套方法论从汽车延伸到机器人,路径清晰且可复制。
未来,Arm 还将与 Anaxi Labs、ANYbotics、FMC³ Robotics、傅利叶、银河通用、Gravis Robotics、联想、麦肯锡、Robotec.ai 等企业与机构持续共同完善这一框架。
从商业逻辑上看,Arm 这套「标准+生态」的组合拳,目的就是形成网络效应,让芯片厂商根据 RL 等级规划产品,软件开发者按同一套标准编写代码,终端用户用统一的语言比较不同机器人的能力。
你能看到,Arm 在尝试成为机器人能力评价体系的推动者和组织者。当底层硬件、操作系统(QNX)、云端 AI 训练(AWS)都基于 Arm 生态进行优化时,任何新进入的机器人公司都会发现,采用 Arm 标准是最省力、最稳妥的选择。
2、AI 正在重构计算:CPU 回归 C 位,GPU 升级 AI 原生
Arm 将技术硬核的戏份留给了自己的「老本行」——移动端的边缘计算。
在边缘侧,Arm 推出了 CSS for Mobile 2,即第二代移动端芯片基础计算子系统,它是一套打包好的核心计算模组,和 Zena CSS 一样,包含 CPU、GPU 及其他关键计算单元,可理解为面向下一代智能移动端芯片的「预制件」,芯片厂商基于此进行差异化开发。
这款产品的设计思路,折射出 Arm 对多智能体时代的一个关键判断:生成式 AI 是「深度思考」,而智能体的工作流程往往是感知、记忆、推理、执行交织并行,并非线性串联。
过去大家拼命卷 NPU 算力,是为了应对单线程深度任务的复杂性;但现在多个智能体要协同工作,低延迟和高效率就变成了首要矛盾,CPU 的任务调度和资源管理能力,重新站上了 C 位。
Arm 曾测算过,传统 AI 数据中心每 GW 需要约 3000 万颗 CPU 核心,在智能体时代这一数字将增加到 1.2 亿颗,需求暴增 4 倍。
那么,智能体时代到底需要一颗怎样的 CPU?
Arm 给出的答案是 C2-Ultra,一个微架构升级,全维度优化后的产品。
相比上一代,C2-Ultra CPU 集群单线程提升约 15%、多线程约 12%,网页性能提升约 15%,应用启动提升约 12%。
一个可感知的案例是,让智能体帮你预订结婚十周年晚餐。上一代平台跑完整套流程要 2 秒,新的 C2-Ultra CPU 集群把它压到 1.72 秒,再配合第二代可伸缩矩阵扩展 SME2 压到 1.55 秒。
单看每个环节百分之十几的提升不起眼,但智能体体验的是延迟的总和,而且一次任务失败就要从头再来一轮,几百毫秒的差距在循环里会被放大成体验的分水岭。
值得一提的是,C2-Ultra 的出色表现,离不开 SME2(第二代可伸缩矩阵扩展)的加持。
具体而言,AI 计算的核心是大量的矩阵乘法。SME2 通过专门的指令集,让 CPU 能一次性处理更大块的矩阵数据。尤其是智能体任务交织在一起,需要 CPU 在 AI 计算和传统控制任务之间灵活切换,SEM2 相当于提供了一个「加速包」。
目前,支付宝、OPPO 和 Vivo 等合作伙伴已采用 SME2 技术。
GPU 这边同样动静不小。
新的 Mali G2-Ultra NX 把神经网络加速器直接塞进了着色器核心,Arm 称其为旗下首款 AI 原生 GPU。
升级的目标很明确,提升移动游戏画质,让手机也能拥有跨平台一致的游戏体验。
但这条路并不好走。移动端的功耗和散热空间极其有限,没法像 PC 那样靠堆功耗换性能;有限的内存带宽也时刻制约着高画质内容的传输。如果 GPU 还老老实实逐帧渲染,很快就会撞上发热、掉帧、续航缩短三座「大山」。
Mali G2-Ultra NX 的破局思路是「用 AI 使巧劲」。
Arm 首次在移动 GPU 中集成了专用神经网络加速器,并将其嵌入着色器核心内部,让 AI 推理成为渲染管线的一部分,而非外挂的后处理单元。基于这一架构,Arm 同步推出了三项关键技术:
- 神经超级采样(NSS):用 AI 将低分辨率画面重建为高分辨率;
- 神经帧率提升(NFRU):用 AI 在帧与帧之间生成中间帧,提升流畅度;
- 神经超级采样与降噪(NSSD):将超分和降噪结合,专为复杂的光线追踪场景优化。
效果如何?在技术演示游戏《光影新生》中,每一帧只有八分之一的像素来自真实渲染,其余八分之七由神经网络实时补齐。最终在仅约 2 瓦的功耗下跑出了 60 帧的流畅画面。
从《暗区突围》NSSD 开关对比界面看下来,画质差异很直观。
需要强调的是,这套神经网络用的是 CNN(卷积神经网络),而非近年火热的 Transformer。设计取舍很明确,不做凭空想象,只做基于真实渲染帧的超分和补全,优先保证画面准确性和稳定性。
如今,叠纸游戏、网易、腾讯游戏、Unity 中国以及虚幻引擎(Unreal Engine)均已出现在 Arm 的 GPU 生态版图中。
回过头看,Arm 在 GPU 上的升级逻辑和 CPU 如出一辙。在移动端极端的功耗约束下,用专门的硬件模块分担 AI 推理负载,把每一毫瓦都花在刀刃上,这是 Arm 一直比较擅长的事情。
3、AI 时代,Arm 是绕不开的「坐标系」
相较于物理 AI 的标准制定,Arm 在云端业务的进攻姿态更为锐利。
它着手干了两件事。
第一件,是推出更强大的「设计图纸」Neoverse CSS N4。相比上一代,性能翻倍,内存带宽提升 75%,单颗裸片最高可搭载 128 个 CPU 核心,采用 3nm 工艺,并首次在 Neoverse N 系列 CSS 中支持 LPDDR6 内存与 PCIe 7.0 互连。
第二件,是亲自下场造了一颗「成品芯片」AGI CPU,这颗芯片采搭载 3nm 制程,136 个核心,发布六周客户需求就超过 20 亿美元。
Arm 判断,数据中心业务将很快成为其最大业务板块。到 2031 财年,公司总营收目标为 250 亿美元,数据中心是其中的主力贡献。
在这一板块上,你能看到 Arm 短兵相接的一面。
比如,在 x86 的腹地攻城略地。
数据中心长期是 x86 的绝对地盘,而最新数据显示,基于 Arm 架构的芯片已占据全球超大规模云计算市场超过 50% 的份额。从 2024 年中的约 18% 起步,仅用约两年时间便完成了跨越。Neoverse 核心的累计出货量也印证了这一点,已达 15 亿颗,其中最近的 5 亿颗不到一年内完成。
还有难得一见的角色转化,从「卖铲人」升级为「淘金客」。
Arm 看准了大模型厂商的 CPU 需求空缺,AGI CPU 的下场,是为了提供更高效的解法。首批客户包括 Meta、OpenAI、甲骨文、火山引擎等。
三条业务线综合看下来,Arm 的产品序列其实是一条清晰的递进曲线:从 IP 核,到 CSS 计算子系统,再到 AGI CPU 成品。Arm 在把过去交给客户完成的环节,一步步纳入自己的产品范围。
但阳谋就在于,这为客户提供了一整套「组合拳」。你可以只买 IP 自己设计,也可以买 CSS 加速开发,或者直接买 AGI CPU 成品。这看似是给了客户更多选择,实则是在用「全栈式」的服务,将客户更深地绑定在 Arm 的生态内。
当然,边界很清楚,至少 Arm 目前对造一颗 NPU,兴趣不大。
这种克制体现了 Arm 的赋能哲学,并非一揽子包揽所有事,而更像是「搭好台不唱戏」。
Arm 自身聚焦于 CPU 计算底座和系统互联,而将 NPU 等专用加速器留给生态伙伴去定义和竞争。CSS 把 CPU 集群、系统互联、安全引擎打包成可直接集成的模块,让合作伙伴在此基础上自由嵌入自己的加速器。
Arm 提供的是舞台和规则,具体的表演还是交给别人。
所以,站在这个节点回看 Arm 的成功,很大程度上是建立了一种「Arm 就是标准」的行业信仰。从手机时代的指令集标准,到如今的数据中心 CPU 标准,再到机器人能力分级框架,Arm 的打法其实都一脉相承,把规模优势沉淀为标准优势。
在 3500 亿颗芯片之后,当所有人设计 AI 计算系统时,Arm 依然成了绕不开的坐标系。
格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。


