6台机器人、8万块积木:原力灵机在WAIC上接受15小时真机裸考

23 天前9.5k
脱离剧本,模型能力才开始被真正验证。

一直以来,具身智能赛道都被模型叙事所主导。

VLA、世界模型等概念轮番占据行业焦点,然而热度之下,信任的缺口却在悄然扩大。

这几乎成了一种公开却又不便言明的行业悖论:越是标榜通用,外界越对其真实能力心存疑虑。

面对这一困境,业界开始分化出不同的证明路径。

一类是实验室 Demo 派,在高度可控的环境中制造惊艳瞬间;另一类是 Benchmark 派,用抽象指标争夺排名高地。

而第三种路径正获得越来越多认同,直播公开验证,将系统置于真实、连续、不可剪辑的公众注视之下。

Figure AI 曾用 200 小时直播展示机器人分拣物流包裹,将技术能力直接暴露于外界审视之中;国内智元机器人与龙旗科技也完成了连续 6 天的真实任务直播。

这些案例表明,行业正从展示最佳状态转向接受持续检验。

与此同时,随着具身智能热度攀升,各类展会上机器人演示虽层出不穷,但那些往往是多轮调试后的稳定版本,任务边界清晰、环境预设充分,甚至不排除隐性遥操或人为干预。

它们无法等价于模型在真实场景中的泛化表现。

在这些分歧与选择背后,真正的问题始终悬而未决:如果彻底剥离「剧本环境」,这些模型还能可靠地成立吗?

原力灵机在今年 WAIC 上给出的回答,是一次大胆的极限挑战:15 小时持续作业,6 台不同类型机器人协同拼装一座完整的长城模型,全程公开透明。

1.png这不再是一场常规演示,而是一次面向真实开放环境的压力测试。

原力灵机将软硬件一体化能力直接推至公众视野,用极端规模和不可彩排的条件,去检验模型在物理世界中的真正底牌。

1、拼一座长城模型,到底难在哪里?

制造业长期受困于一个「最后 20%」的瓶颈。

尽管自动化技术日新月异,全球仍有约 20% 的工序,像精密装配、柔性物料处理、缺陷修复、狭小空间操作等,难以被传统机器或固定程序有效替代。

这些环节往往要求微米级精度、强感知判断和即时适应性,高度依赖人工经验。

原力灵机选择的长城模型拼装任务,恰好复刻并极端放大了这一「最后 20%」的挑战。

这座模型长 3.5 米、宽 1.5 米、最高点 1.1 米,由 81920 块微型积木构成。4 台桌面机器人与 2 台人形轮式机器人协同作业,需在 15 小时内完成全部拼装。

这不仅考验单项技术,更是将海量重复操作、多机协同和长时稳定执行压缩进一个高强度、高密度的现实场景。

第一重挑战,来自极致海量重复的精细操作。

81920 块积木意味着每台机器人平均每 12 秒左右就要完成一次精准动作,积木尺度微小,操作精度要求达到亚毫米级(0.1—1 毫米),已超过人手自然抖动极限(约 0.3—1 毫米)。

这意味着机器人必须在光照变化、轻微振动等现实干扰下,持续维持感知、驱动与执行的精密闭环。

长期重复劳动对模型的鲁棒性和抗漂移能力提出极高要求,任何微小偏差的累积,都可能在数小时后导致整体失败。

2.jpeg第二重挑战,是 6 台异构机器人组成的集群协同。

桌面机器人善于细腻的桌面级操作,人形轮式机器人则拥有更优的移动和姿态调整能力,二者需要形成有机配合。

每台机器人需要具备自主感知、决策与执行能力,并通过实时通信协商分工:有的负责小件拾取与初装,有的承担大件定位与结构搭建。

这种物理世界中的多智能体协作,远比单机任务复杂。

任务分配、冲突消解、进度同步环环相扣,任何一台机器的延迟或失误都可能拖累整条装配链,甚至影响模型结构的稳定性。

3.png第三重,也是最关键的:全程纯自主执行,无后台遥操,无预设轨迹脚本。

这与许多展会特制版 Demo 形成了鲜明对照,后者通常在可控环境中反复调优,甚至暗藏人工干预以保证完美亮相。

而原力灵机的挑战直接置于展会真实场景,光照波动、意外扰动、不同机型的泛化差异都无从回避。

模型必须实时理解任务进程,动态适应环境变化,并在长达 15 小时的连续作业中保持前后一致。

这正是对具身智能模型可验证性的直接拷问。

通过拼长城模型这一任务,原力灵机不仅在技术层面直击制造业痛点,更在验证范式上迈出了创新一步。

它用一种公开、可量化、不可剪辑的方式,证明模型能力不再停留在 PPT 或封闭实验室,而是真正走进物理世界,接受最严苛的检验。

2、底层大脑 DM0.5+DW0.5:双模型协同,扛下 15 小时长城拼装极限考验

一场持续15小时、六台机器协同、亚毫米级精度的物理实景挑战,背后必然有一套真正经得起真实场景检验的技术体系。

驱动这场拼装任务的,是原力灵机最新的通用具身基础模型 DM0.5 与 DW0.5 世界模型的联合体系。

如果说初代 DM0 解决的是在实验室里完成指定动作,那么这套新体系要回答的问题只有一个:机器人能不能在真实的、充满变数的环境里,像人一样持续稳定地干活?

在这场硬仗中,DM0.5 扮演了执行大脑的角色,81920 块积木的识别、抓取、对准、拼装,每一步都由它自主完成。

为了让它在开放世界扛住 15 小时不间断作业,原力灵机在五个维度上做了系统强化。

第一,模型不需要背答案。传统机器人依赖预设脚本,每一步都提前写好。

DM0.5 具备零样本执行能力,面对位置、角度各异的积木,它根据实时的语言和视觉信息现场判断该怎么做,而不是机械复现记忆中的动作序列。

4.png第二,它不会做完就忘。

15 小时连续作业中,大量关键信息不会始终出现在当前画面里,例如某个结构最初什么状态、中间调整过什么位置、上一块积木拼在了哪里。

DM0.5 设计了上下文记忆机制,最长支持 60 秒的有效记忆,让模型始终清楚从哪来、到哪了、接下来该做什么。

其次,它在动手之前会先想一想。

传统模型通常从感知直接跳到动作,而 DM0.5 在中间加入了具身推理环节。

它被训练去回答现在做到哪一步了、环境发生了什么变化这类问题,好比有经验的工人每完成一步都会确认进度再决定下一步。

模型也不怕面对意外情况。真实环境里,相机角度会变、积木可能被碰歪、甚至有人为干扰。依赖固定轨迹的机器人遇到这种情况就会卡死。

而 DM0.5 在测试中即便目标被移动或视野被遮挡,也能重新观察、重新规划动作路径,继续完成任务。

最重要的是,它还能一脑多用。6 台机器人构型各不相同,桌面机械臂负责精细拼装,人形轮式机器人负责大件搬运。

5.pngDM0.5 通过多机型联合训练,让同一套模型在不同本体之间迁移部署,不同构型、不同分工,共用同一个大脑。

但只有 DM0.5 还不够,行业也面临另一个困境:真机试错代价极高,速度慢、设备贵、一次失败可能需要人工复位数分钟,甚至损坏硬件。

如果用纯真机数据来训练,规模很难做大。这就是原力灵机 DW0.5 世界模型要解决的问题。

DW0.5 的角色,是一个低成本试错模拟器。

它不直接执行动作,而是回答三个问题:给定当前状态和候选动作,世界会如何变化?这个变化是让任务更接近成功还是正在偏离?这些信号能否转化为训练数据反哺给 DM0.5?

在长城拼装中,这套机制的作用非常直接。

假设面对一块积木有几种不同的抓取方式可选,角度偏一点、力度大一点,但在真实世界里不可能都试一遍。

DW0.5 的作用就是:在虚拟空间中把几种候选动作都预演一遍,生成对应的未来画面,再做出价值判断:哪一种方案成功概率更高?

然后把结果反馈给 DM0.5,让它选择最优方案执行。

为了让这种预演足够可信,DW0.5 在三个关键设计上下了功夫。

第一,动作必须能精准驱动画面变化。

如果向左推和向右推生成的未来看起来差不多,那它就只是一个好看但无用的视频生成器。

DW0.5 采用帧级动作绑定:第 i 帧画面必须严格对应第 i 组动作指令,向左和向右在模型内部从一开始就走不同的计算路径。

第二,它必须学会模拟失败。

很多世界模型只见过成功轨迹,导致无论给什么动作都倾向于生成任务完成的画面,这无法告诉模型这个动作可能会把积木推到难以恢复的位置。

DW0.5 的训练数据中同时包含成功与失败轨迹,并通过仿真大规模覆盖各种偏离、卡住、恢复的中间状态,既能告诉模型什么是对的,也能警告什么是错的。

第三,它能把模拟结果转化为可训练的反馈信号。

通过内置的价值评估模块,DW0.5 能给每一段预演的未来画面打分,当前状态离成功还有多远、哪个动作方向更值得尝试并将这些分数作为奖励信号,用于 DM0.5 的后续训练优化。

这套DM0.5 执行、DW0.5 预演的协同机制,直接降低了后训练阶段对真机数据的依赖,让模型可以在不频繁占用物理设备的情况下持续优化。

如果说长城拼装是一场 15 小时的真实大考,那么 DM0.5 是在考场上埋头答题的考生,而 DW0.5 是考前的模拟训练系统。

它让考生在走进考场之前,已经在虚拟环境里把各种可能的题目和应对策略练了无数遍。

两者结合,才构成了一套完整的、可闭环迭代的技术体系。

这场拼装挑战验证的核心命题是:当执行、预演、反馈、优化这几层能力同时叠加时,这套系统还能不能保持稳定?

3、真好用的模型,需要真落地的检验

很长一段时间里,具身智能模型的进步主要停留在软件层面。

参数在膨胀,数据在增加,榜单在刷新,但这些进步有一个共同特点:缺乏真实环境验证的模型,本质上不可证伪。

这也是为什么许多模型在 Demo 中表现出色,一旦面对真实场景就会明显退化,因为 Demo 是可以反复试错、精心剪辑的,但真实世界不给再来一次的机会。

然而,这种不可证伪的状态正在被打破。

行业已经形成了一种共识性的转向:具身智能的竞争,正在从谁说得好变成谁扛得住。

这种转向体现在两个维度上。

第一个维度是对物理交互能力的全面要求。一个可用的具身模型,不能只在固定工位上完成单一动作。

它既要走得稳,即在复杂环境中自主移动、避障、导航;又要手够细,在毫米级甚至亚毫米级的尺度上完成精密操作。

从抓取到装配,每个环节都涉及连续的感知与控制,而非孤立的动作。这种 Locomotion(运动)与 Manipulation(操作)的结合,是通向实际应用的基础门槛。

正因如此,Figure AI 做快递分拣直播,智元机器人进龙旗工厂产线作业,本质上都是在「手+脚」的复合能力上接受检验。

7.png第二个维度是应对复杂长尾问题的能力。

真实世界远比任何数据集都更加多变,环境扰动、设备误差、任务变化会不断涌现。模型不能依赖短时最优策略,必须在长时间运行中持续适应。

无论是星动纪元在顺丰、邮政的真实场景里进行物流分拣,还是原力灵机的 15 小时长城拼装,本质上都是用时间和复杂度来逼近真实环境,逼出模型的泛化底牌。

这两个维度的共同点在于:它们是公开的、可证伪的。

在长时间、全透明的任务中,模型的表现无法通过剪辑或筛选来美化,它要么完成任务,要么在过程中暴露问题。

这种结果导向的验证机制,让模型能力第一次变得可以被直接比较、被公开审视。

这或许正是一个分水岭。

过去,企业习惯用不断扩展的任务表来证明能力,我能做 A,也能做 B,还能做 C,但这种证明方式永远可以无限延续。

未来,真正的分水岭在于:谁能拒绝用任务表来冒充世界,谁能让模型在真实的、开放的、没有脚本的环境里站得住脚。

世界本身才是最好的训练场,而每一次真实的交互、每一次没有脚本的执行,才是对模型能力最诚实的评判。

当具身智能走到这个阶段,评判标准也在同步进化:模型重要的不再是在已知任务里能做什么,而是在未知变数面前能否一直做对。

而这,才是从实验室走向现实世界的关键一步。

格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。

App内直接打开
商务、渠道、广告合作/招聘立即咨询

相关文章

全球与中国肺炎球菌检测市场规模分析及行业发展趋势研究报告

细分市场报告智库 · 2分钟前

cover_pic

2026年全球政府合同与合规市场规模将达到4,620亿美元

细分市场报告智库 · 6分钟前

cover_pic

2026年全球质子交换膜燃料电池(PEMFC)市场销售额规模达到91.56亿元

细分市场报告智库 · 11分钟前

cover_pic
我也说两句