端侧智能,真正难的是最后一公里

3 小时前11.0k
在碎片化的混战中,打通最后一公里

一台手机,为什么装不下一个 2B 模型?

以一台 12GB 运存的主流中端安卓机为例,操作系统本身要吃掉 3-4GB,即使不打游戏,同时挂着微信、抖音、淘宝等 APP,也要占 2-3GB。

而一个 2B 模型如果不做量化,以 FP16/BF16 精度运行,权重部分就要占约 4GB,再加上上下文带来的 KV 缓存,需要占用的空间直接呈爆炸性增长。

过去几年,大模型的主战场在云端,但随着技术供给和商业需求的成熟,端侧智能开始成为一个独立赛道。

把智能装进每个人身边的设备里,是一个诱人的想法。手机、电脑、汽车、可穿戴设备、机器人……端侧智能市场带着「AI 时代入口」「超级出货量」的标签,但规模化落地仍面对诸多难题。

北京智源人工智能研究院联合端侧智能北京市重点实验室在《端侧智能 2026——规模化落地元年》报告中指出,端侧智能规模化落地的最大障碍是碎片化。

N 种芯片 × M 种模型 × K 种终端可以无限组合,终端有各种各样的物理瓶颈(如算力、内存、功耗)和商业要求(时延、隐私、成本等),某一项没优化好,整体跑不通就是鸡肋。

智能最终会以什么形态来到人们身边,是超级机器人,还是《Her》里的 AI 伴侣,又或是《钢铁侠》里贾维斯那样的贴身管家,现在还说不准。但可以肯定的是,终端上的智能有多强大,取决于一个乘法公式——模型要强,还要装得下、跑得起来,能在真实场景里满足需求。

技术、工程、商业,环环相扣。那么,在这个高度竞合的市场里,未来的趋势是什么?一个真正能走到消费者前的杀手级端侧产品离我们还有多远?还需要跨越哪些障碍?

1、第一场战争:把智能做密

如果我们细究「智能」二字,就能发现市场上有很多伪需求,也会明白为什么高智能密度的端侧模型是一切的起点。

这个模型,既可以是通用基座,也可以是高度专用的模型。

具身智能赛道融资高企,但泡沫大、泛化性弱、缺乏真实市场,这已是业内普遍看法。但如果只看机器人是不是进了真实场景,看出货量、任务完成率、ROI,很容易又会陷入一个怪圈——那真的是「智能」吗?

比方说,饮品自动贩卖机是早就有的东西,技术和市场都已经很成熟,但具身浪潮来了之后,很多厂商非要让一个机器人去做咖啡、打冰淇淋,简单的事情就开始变得复杂起来。

虽然厂商可以辩解「这背后的技术原理根本不一样」,但仔细想想,如果打冰淇淋就是它追求的应用场景,这个机器人根本谈不上 PMF(Product Market Fit)——它昂贵且不稳定,却要挑战一个早已成熟到顶的市场。

这些伪场景的共同点是:无论再怎么复杂,也可以被抽象为清晰、可穷举的「if-else」模型,用自动化设备就能解决,谈不上真正的「智能」,也没必要蹭这个热点。

「智能」的起点,一定是一个具备强大外推性、泛化性的模型,它不是闭集内的有限映射,而是可以适应开放环境中各式各样的输入,完成多种推理输出。

它能够适应非结构化环境,处理长尾状况,能够理解自然语言意图、持续学习和进化。

把这种能力限定在「端侧」,就引出了端侧智能的起点:高密度的端侧大模型。

为什么端侧不能只是云端模型的缩水版?

因为端侧意味着模型从训练起始,就要考虑未来运行设备的物理资源约束,把这些条件纳入问题后求解,而不是把一个云端大模型通过蒸馏、剪枝、量化等方式做小,让它当模型世界里的二等公民。

智能密度,是端侧大模型技术领域的「北极星式」指标。面壁智能恰好选择了这条路线。

2024 年,面壁智能通过检验数十个开源大模型,拟合出了一条「密度定律」,即大语言模型的最大智能密度随时间呈指数级增长,大约每 3.5 个月翻一番。

也就是说,只要大约 100 天,一个小模型就可以凭一半参数达到先前大模型的能力。

把模型的智能做密,而不是参数做大,这在当时仍是一条非共识路线。

面壁发布的 MiniCPM5-2B 模型参数规模仅 20 亿,却位列全球 4B 参数规模以下开源基座模型的第一梯队。

据官方口径,MiniCPM5-2B 支持工具调用、深度搜索、代码生成等任务,初步实现了端侧通用 Agent 雏形。

它的价值,不只是把模型做小,也证明了一个方向: 当端侧设备成为模型运行的第一现场,参数规模本身正在从核心指标退居二线,单位参数能够换来多少有效智能更加重要。

面壁选择的路是做深基座,即一条先通用再专用的道路。它自研了「AI 制造 AI」的 ForgeTrain 预训练框架,并构建了高知识密度数据治理等工程。

这些也是成为端侧大模型玩家所需要具备的基本能力:不仅模型要达到 SOTA 级,复杂工程能力和 Infra 建设也要能持续支撑这种前沿水平。

目前,据面壁智能公开信息,其技术已搭载于吉利银河 M9、长安马自达 EZ-60 等多款车型,并与三星手机达成合作,将模型搭载于其数款旗舰机型。

大模型提升能力,无非围绕数据、架构创新、训练方法等展开;因此也有企业选择了与面壁智能不同的路径来提升智能密度。

例如,与惠普合作的元空智能。早期,元空面向 C 端推出 AI Excel 产品 ChatExcel,由此积累了大量真实的用户操作链路数据。其端侧模型 Boxer 系列基于阿里千问等开源模型做大规模数据后训练,提升在办公场景中的能力。元空通过与惠普合作,在 PC 中预装端侧模型与智能体来打开销路。

切口小、需求真,从一开始的 ChatExcel 就是如此,所以元空之后顺理成章地奔向 AI 办公、AI 科研这两个更「专」的领域,也选择了适合自身的端侧设备:真正作为生产力的电脑,而不是终端厂商把持入口、模型需要做更小、竞争也更激烈的手机,这样一来也能装下 35B 的模型。

元空智能虽然覆盖的设备和场景更窄,但也因此更容易形成明确的产品和商业闭环。

2、第二场战争:把模型送进终端

模型密度只是起点,要真正把模型装进终端,能「跑起来」且「跑得快」,还要跨过多个物理瓶颈。

以手机为例:

第一,要「装得下」——端侧模型虽然已经做得很小,但受功耗、续航限制,还被日常使用挤占,仍需进一步压缩。

第二,要「跑得久」——手机持续运行会降频、发热,峰值算力不等于可持续算力,用户的真实体感远比标称算力复杂。

第三,要「搬得快」——很多时候瓶颈不在计算,而在存储搬运和内存带宽,软硬件必须协同优化。

第四,要「分得清」——端云如何分工、AI 如何调用本地设备与传感器,决定了整体的效率与体验。

除此之外,很多终端场景还有更严苛的约束。

比如,工业机器人对时延极其敏感,做个动作总不能一直等着云端回传结果,本地模型必须完成「感知——推理——决策——行动」的闭环。

车则要求断网也能用,不能一进入山区、隧道等弱网环境就失效,必须离线可运行,并保障基本功能和安全。

端侧 AI 最大的工程红利,不一定来自下一颗更强的芯片,可能来自下一层更好的适配能力。

如何把模型送进各式各样的终端?模型厂商、芯片厂商、云厂商都在提供工具链和平台,还有大量的运营商与服务商参与其中。这是一条上下游高度耦合的产业链,只做软件中间件的企业其实并不是主流——市场上大致有四种典型打法。

一是搞垂直闭环的巨头。像华为、苹果那样,从芯片、OS、终端到模型都做,虽然不是样样顶尖,但起码能在全栈研发中协同进化。因为它们的利润大头在硬件而不是云,所以许多时候趋向于闭源,致力于合力打造更极致的端侧产品体验,以此维持品牌形象和客群忠诚度。

垂直闭环的好处很明显,它们也许能把那个乘法效应的结果放到最大,能够保证一致体验、功耗与安全,但生态同时也会较为封闭。

二是两个或多个巨头之间的横向联盟。在 PC 时代,这类组合最有名的例子是 Wintel(Windows 操作系统+Intel 芯片)。

Wintel 式联盟在 AI 时代不一定能复刻。Windows 和 Intel 在当时各自是其领域内几乎唯一的选项,二者的结合形成了强大的引力场,将整个 PC 生态牢牢吸附。而今天的 AI 终端生态是多极的,操作系统有 Android、iOS、HarmonyOS,芯片有高通、联发科、苹果、三星,云端 AI 有谷歌、OpenAI、Anthropic。

强强联合效应仍然有效,但变数不少。科技巨头要在端侧智能落地中发挥「乘法效应」,很大程度上依赖于一个足够大的通用市场,即平台方的市占率已经沉淀为事实标准。而一旦进入具身智能、智驾等新场景,许多技术共识和标准都尚未形成,这种联盟的力量就会明显减弱,也会给新入局者更多机会。

三是开源生态。为了解决碎片化的问题,国家、行业统筹推出各类开源公共品和标准规范,也有一些企业以开源为商业战略,比较典型的是阿里——建设开源社区,摊薄智能落地的成本,吸引到更多开发者后,在普惠的同时也做大了自己的生态。

四是小而专的服务运营商。大厂追求标准化,难以精准覆盖到小客户琐碎的定制化服务需求。而针对单个企业和业务的复杂工程优化,比如数倍的推理效率,本身可能依赖的正是众多琐碎的工程细节叠加,如同造车一样,零部件的壁垒或许并不高,但整合能力却有天壤之别。端侧智能讲究用一次本地部署摊平后续成本,所以许多工程能力强、报价低、服务好的小厂,恰好能抢在大企业前占住坑位,锁定长尾客户,这也是一种可行的商业模式。

3、最后一公里:Agent、生态与新交互范式

端侧智能发展的最后一公里,是端侧智能体与新型交互范式的变革。目前,手机是 AI Agent 和 AI OS 竞争最集中的终端之一。

触摸屏、网格、APP 图标,这套交互有一个前提:使用者是人。

想想 UI 系统里那些经典的设计:键盘要放置得符合人体工学、按键用高亮颜色引导点击、程序加载时要放 loading 动画安抚着急的用户……这些设计都来源于同一个前提。

但如果程序的使用者是 Agent 呢?在理想化的未来里,AI OS 或许会成为新的安卓:未来的程序开发考虑的不再是装在安卓还是苹果上,而是会被什么样的 AI OS 调用、如何把自己封装成 AI 可以丝滑调取的能力。

各方想要争夺这个可能的新入口,但现实阻力重重。

因为 Agent 操作手机这件事,直接卡住了以广告和流量为食的众多互联网产品的命脉。

而且,App 没有天然动力把自己变成 Agent 的工具箱。Agent 需要调用 App,App 就需要开放能力,这意味着流量、数据、支付、用户关系可能被重新分配。Agent 越强,需要的系统权限就越多,这会带来更高的风险。

AI Agent 操作手机主要有两种技术路线:一是「读屏+模拟操作」的 GUI 路线,通过系统级权限读取屏幕内容,再模拟人类的点击、滑动和输入;二是与 APP 厂商约定开放服务接口、授权能力的 API 路线。

由字节豆包团队与努比亚合作的豆包手机一代,核心技术路线就是 GUI,但上线仅数日,就接连触发了微信、淘宝、支付宝和多家银行 App 的风控。

因此,二代豆包手机(努比亚 NaviX Ultra)从 GUI 转向以 MCP(模型上下文协议)和 A2A(智能体对智能体)协议为主的路线,与应用直接沟通。

阶跃星辰则直接走 API 路线,通过调用合作厂商开放的服务接口,由 App 厂商决定向智能体开放哪些能力,并共同约定用户授权、数据使用和责任边界。

由此可见,除了解决 AI 调度本地计算资源的技术问题,互联网应用向 AI Agent 开放,也是 AI 手机能做起来的关键。一个 Agent 操作得再丝滑,如果无法完成打车、购物、点外卖,这款手机也是鸡肋。

但这个过程的竞争非常激烈。终端厂商难以放手。据 IDC 数据,2026 年第二季度中国智能手机出货量约 6600 万部,同比下降 4.3%,连续第五个季度下滑。AI 成为高端机型争夺用户的新变量,vivo、荣耀都选择把智能体入口握在自己手里。

而AI Agent 进入手机之后,真正难的不是让 Agent 学会点击,而是让 OS 厂商、App 厂商和模型厂商重新划分权限与利益边界。

模型厂商的硬件焦虑显而易见:不掌握终端,模型层就容易沦为被采购的组件。这也是阶跃星辰选择向硬件延伸的重要背景之一。

具备模型、芯片的大厂还会跨界竞争。阿里云试水 QwenBook AI 平板、字节做豆包 AI 手机就是例子。这些厂商已经建立起规模庞大的云上帝国,当端侧 Agent 成为新的分发路口时,便不可能放过这个将服务进一步下沉到人们身边的机会。

在入口之争尘埃落定之前,超级 APP 的 AI 化仍会是主流。小红书的 AI 搜索,千问 App 的「一句话点外卖」,高德的扫街榜和 AI 行程规划,这些超级 APP 不依赖系统级权限,只在自己的场景和生态内封装 AI 能力。随着 AI 能力越来越强、越来越深地嵌入整个产品,它们可能从传统 App 进化为 AI 原生 App,最终被生态调用,也可能成为入口本身。

值得玩味的是,第二代豆包手机内置的豆包手机助手推出了 SAEP 协议(屏幕自动化操作声明协议),大意是:手机发布后 30 天内,豆包不会硬接、也不会主动调用没开放的 App;但 30 天一到,如果开发方既不拒绝也不回复,就默认同意。

这是一个讨巧的协议,也说明各方还在博弈、试探和商量。社交媒体平台上,有购买此款手机的消费者吐槽很多 APP 都用不了,但也有人提出可以等一个月公示期后再看看生态。到那时,豆包手机的生态边界才会第一次真正显现。

端侧智能的规模化落地,注定是一场考验综合能力的铁人三项,某一项技术的领先并不足以胜出。

模型做得再密,也要有人把它装进终端;OS 调度再智能,没有 App 厂商愿意开放接口,它就是一个光杆司令。

碎片化的现状是障碍,也是机会。小企业能在缝隙里活下来、长起来。在激烈的竞合中,也可能杀出新一代标准的建立者。到那时,智能将真正「飞入寻常百姓家」,实现规模化落地。

格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。

App内直接打开
商务、渠道、广告合作/招聘立即咨询

相关文章

草甘膦景气持续修复,四大龙头中报业绩普增

证券市场周刊 · 昨天 21:19

cover_pic

钟薛高重启定价腰斩,香飘飘9家奶茶店试水,老品牌为什么都在“自降身价”?

摩根商研所 · 昨天 20:22

cover_pic

35小时工作制火遍全网:人人羡慕胖东来,可老板们为何学不会?

龚进辉 · 昨天 19:50

cover_pic
我也说两句