
Demo 内卷没有尽头,模型成功进场景才是答案
具身智能行业正在从一个极端走向另一个极端。上半年,行业争论最多的问题是「具身智能到底有没有商业化的可能」;
而现在,几乎每家公司都在宣布自己「已经商业化」,每家都能拿出一条打光精致、动作流畅、卡点精准的 demo 视频。
最典型的一幕,出现频率高到近乎行业标配:一条物流传送带,一台机器人给包裹翻面——不管机器人构型是否适合这个任务,这个镜头几乎已经成为具身智能公司的「标准答卷」。
但很少有人接着往下问三个问题:
- 这条 demo 是奔着落地去的,还是只是一次摆拍?
- 翻包裹这个动作,是模型驱动完成的,还是工程师手动调出来的?
- 更关键的是——这个模型换一个场景,还能不能接着干活?
这也是原力灵机训练 DM0.5 时反复回答的基准问题:不是模型能不能演给你看,而是它能不能被规模化地用起来。
DM0.5 是原力灵机面向开放世界的通用具身基础模型,试图从三个维度给出答案:多个权威评测上的均衡表现、系统级的推理效率优化,以及从架构层面贯穿始终的「具身原生」设计理念。
1、全科优秀,而非单科满分
单一榜单的高分,在具身智能领域一向被过度解读。
一个模型在某个仿真评测集上表现优异,不代表它换一个机器人本体依然稳定;
一个模型在某类任务上领先,也不代表它切换到导航或全身控制任务时同样从容——针对性优化很容易在特定评测框架下堆出高分,但这种优化未必能迁移到框架之外的真实场景。
DM0.5 选择的路径是覆盖,而非押注单一评测。
在真机与仿真评测中,DM0.5 均刷新了纪录:LIBERO 综合成功率达到 99.0%,RoboTwin 2.0 简单和复杂场景下成功率分别达到 93.6% 和 93.3%,VLA-Arena 不同难度设置下的成功率分别达到 89.0%、53.6%、44.1%。
同时, 在导航场景仿真测试中,R2R 和 RxR 的 Val-Unseen 成功率分别达到 59.7% 和 65.5%,相比所有基线方法均取得了显著优势。

更值得关注的是真机评测 RoboChallenge Table30 V2 的表现——面对 ARX5、UR5、ALOHA、Dexmal-Mirror 四种异构机型、30 个复杂任务,DM0.5 以 43.0% 的整体成功率、54.42 的综合得分位列第一。
分平台看,ARX5 与 UR5 两个单臂平台成功率分别达到 67.2% 和 70%;而在难度更高的双臂协同任务上,模型同样保持了稳定的空间定位与动作时序规划能力。
单臂表现好,双臂没有明显掉队——这正是判断一个模型是「全面」还是「偏科」的关键信号。
支撑这种均衡表现的,是一套体量可观的数据底座,三种数据源分别对应三个不同的问题:
- 5 万小时高精度真机操作数据,覆盖超过 100 种动作,解决真机精度问题,实现秒级精细指令对齐;
- 10 万小时 Egocentric 场景视频,解决场景多样性问题,支撑毫米级 3D Landmark 生成;
- 100 万平方米场景重建数据,解决仿真-真实一致性问题,用以缓解 Sim2Real Gap。
三个数据源共同支撑起模型在导航、抓取、全身控制三大任务类型、六类机器人本体上的覆盖能力——从 Franka 单臂到 Dexmal-Mint 双臂,从 Pick、Put、Cover、Rotate、Push、Pull、Wipe、Stack 八项核心原子动作,到颜色、形状、大小、位置关系、长序列指令等复杂指令遵循,模型在多个维度上没有出现明显的能力凹陷。
相较 DM0,DM0.5 的 Zero-shot 成功率提升 31%,Few-shot 提升 45%,Fine-tuning 提升 20%。
三项指标同步提升,而非某一项单点突破,这一点值得留意——它说明能力的提升来自架构和数据的系统性优化,而不是针对某个测试场景的定向调优。
2、系统级推理优化,单卡实现超 9 倍加速
推理速度在实验室场景中常常被低估,但在真实部署中,它是决定一个模型能否可用的硬性约束——机器人的每一次动作决策,都需要在物理世界的实时节奏内完成。
延迟越高,交互的滞后感越明显;滞后感累积到一定程度,模型在人机协作、动态干扰等场景中会直接失去可用性。
原力灵机 DM0.5 没有停留在优化某个 kernel,而是让整套 VLA 推理系统快了一个数量级:
联合优化 Vision TensorRT、Tuned FlexAttention、FP8 E4M3 Tensor Core Prefix MLP、Triton Suffix 融合算子,以及启动期 CUDA Graph,将在线执行压缩为「静态数据搬运 + 一次 graph replay」,不再需要请求时反复 capture。
让具身智能模型从 500ms 级执行迈入 60ms 级模型推理、70ms 内在线响应。
模型核心延迟从 534.04 毫秒降至 57.49 毫秒,单卡实现 9.29 倍推理加速,延迟降低 89.2%;
线上 API 响应 p50 为 67.75 毫秒,p90 为 70.01 毫秒。而在 2,000 个 LIBERO episodes 上的验证显示,精度几乎无损,从 98.45% 降至 98.40%——速度提升没有以牺牲精度为代价。
另外依靠算法的极致优化,如今仅需一块 4090 消费级显卡,即可在 18 小时内 完成一个全新下游任务的专家级微调训练,彻底打通真机部署的成本壁垒。
3、具身原生:架构创新是持续领先的根本
前两点解决的是能力与效率的问题,第三点更接近根本——DM0.5 的架构设计从起点就是面向具身任务,而非在通用语言模型基础上做适配性改造。这体现在三处架构创新上。
上下文抽象层让 DM0.5 原生支持最长 60 秒的记忆能力,模型能够记住自己此前的动作序列,这是长程任务的必要条件——桌面收纳场景中「记得来处,才能准确放回原位」,正是这一能力的直接体现。
基于这一长记忆特性,模型进一步解锁了 Video Prompt 能力:机器人观看一段人类示教视频后,能够即时对齐并完成任务,交互方式不再局限于语言指令。
具身思维链任务回应了一个业内普遍存在、却较少被明确讨论的问题:缺乏语言理解能力的 VLA 模型,本质上更接近动作数据集的复读机。
原力灵机 DM0.5 通过任务规划与动作生成两大类、11 项推理任务,让模型对「指令、本体、环境」进行三方联合建模,其中反事实任务的构造,要求模型真正理解指令背后的意图,而非记忆动作模式——这也是前述 Zero-shot、Few-shot 成功率能够同步提升的技术基础。
轨迹对齐层解决的是一个更工程化的问题:动作监督从「逐点对齐」转为「轨迹对齐」,借助约束动态规划计算最优匹配,解决动作轨迹不一致的问题,使动作学习本身更稳定,模型在精细操作上具有更明显的优势。
在这套架构之上,DM0.5 引入了双系统机制(Sys2 + Sys1):Sys2 负责理解、拒绝干扰与大局预判,Sys1 负责高频高质的动作响应。
这一机制直接体现为模型的抗干扰能力——面对相机视角骤变、面对人类动作突然打断,模型仍能保持对当前状态的准确判断,并自适应修正后续动作。
这类能力通常不会单独出现在评测榜单上,却是决定模型能否走出摄影棚、走进真实产线的关键变量之一。
4、全面开源:把模型交给开发者社区去检验
原力灵机一直坚持推进开源,协同全球开发者打造真正的具身智能生态。
上个月,在国际电信联盟(ITU)具身智能焦点组(FG-EAI)首次线下会议上,原力灵机(Dexmal)正式当选 WG9「开源生态(Open Source Ecosystem)」工作组组长单位。
DM0.5 不只是原力灵机的基础模型,也是一个能被整个社区共同使用、共同打磨的开放基座。原力灵机正将更多模型权重、跨平台部署案例和应用实践开放。
目前,DM0.5 已全面开源,模型权重、训练框架,以及从 LIBERO 到 RoboTwin2、RoboChallenge 再到 SO101 的多个下游任务完整工作流,已陆续在 GitHub 与 Hugging Face 上开放。
相比再拍一条更精致的 demo,把模型交给开发者社区去检验,或许是回答「能否真正进场景」这个问题更直接的方式。
基于 DM0.5 的最新 demo——SO101 抓取方块任务监督微调(SFT)展示了 DM0.5 强大的 Few-shot 与 Fine-tuning 能力:
模型能够快速适配 SO101,并同步开源相关模型、数据集及完整 LoRA SFT 训练工作流,为开发者提供可复现、可扩展的实践参考。
格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。


