
看一段视频就能学技能!机器人“一教就会”新时代来了

作者:吕鑫燚
出品:具身研习社
过去两年,具身智能行业最核心的话题,都落在了数据身上。
机器人掌握抓取、整理、叠衣服、使用工具等技能都离不开数据的浇灌,为此,行业投入了大量资源采集操作数据。有人通过遥操和本体设备反复示范,有人在仿真环境中生成任务轨迹,也有团队不断增加场景、物体和动作的覆盖范围。
但机器人真正进入现实环境后,还会遇到另一个难题:面对一个没有学过的新任务,很难用预训练模型直接应用,它往往仍要重新采集数据,再进行微调和验证,才能获得稳定效果。
在工厂等任务较为单一的标准化场景中,这种方式尚能运行。但在家庭、商业服务等开放场景中,任务更零散,环境变化也更大。不同家庭的物品、空间和习惯都不一样。如果机器人每学一个新任务,都要重新采集数据和训练,落地成本将很难下降、落地周期也被拉得无限长。
自变量机器人日前发布并开源的HOST框架,就尝试改变这种学习方式。
HOST全称为Human-to-robot One-Shot Skill AcquisiTion,即“人类到机器人单样本技能获取”。它希望让机器人只看一段数十秒的人类演示视频,就能理解任务并学习新技能。实验中,机器人只观看一段平均29秒的人类视频,复现新技能的成功率达到62%。与Pi-0.5结合微调的方案相比,HOST所需的数据量只有其1/50,学习时间只有其1/500。
但HOST真正重要的地方,不只是更快。
它改变了机器人向人类学习的思路。过去,很多方法试图把人类动作直接翻译成机器人动作。HOST则不要求机器人照着人的身体运动,而是先理解任务完成后的结果,再根据这个结果规划自己的动作。
这一次,机器人不再靠“死记硬背”掌握技能,而是懂得每段动作轨迹对应的结果。知其然,更知其所以然。

很长一段时间内,业内更偏好让机器人通过人类视频学习,人做一遍,机器人看一遍,然后照着做一遍。
这是一个很自然形成的逻辑,但真正执行时,问题很快显现。
人和机器人的身体结构完全不同。人类可以用五根手指拿起杯子,机器人可能只有两指夹爪。人的手腕、手指和肌肉,也无法直接对应机器人的关节和电机。
不同机器人之间的结构也不一样。同一个任务,人形机器人、轮式双臂机器人和单臂机械臂的完成方式可能完全不同。因此,直接模仿动作可能并不是最通用、最简单的办法。
HOST绕开了这一问题。它不先问“人类的手是怎么动的”,而是先判断“这个动作完成后,环境发生了什么变化”。
例如,人类拿起桌上的杯子时,HOST关注的不是手指怎样弯曲,而是杯子从桌面上被拿起。随后,机器人会把这个结果转换为自身视角下的目标画面。最后,它再根据目标画面反推出机械臂和夹爪应该怎样运动。
整个过程可以分成三步:先判断自己执行到了任务的哪个阶段;再理解人类动作产生的结果,并转换为机器人视角下的结果;最后根据目标结果推理动作并执行。
这样一来,视觉结果就成了人类与机器人之间的“中间语言”。
不同的人可以用不同方式拿杯子,不同机器人也可以使用不同夹爪。只要目标都是“把杯子稳定拿起”,机器人就可以根据自己的结构寻找合适动作,而不必逐帧模仿人类。
这更接近人的观察学习方式。人类学习一项新任务时,也不会记住示范者每一个关节的运动。我们通常先理解对方想做什么,再结合自己的身体和工具完成任务。HOST希望让机器人也具备这种能力。
理解结果只是第一步。机器人还要解决更实际的问题:人类和机器人的执行速度通常不同。
比如,一段视频里的人用10秒完成切菜并开始翻炒,但机器人在10秒时可能还没有切完。如果系统只按照时间播放视频,机器人就会提前看到后面的步骤,整个任务很快错位。
因此,HOST不是按时间对齐,而是按任务进度对齐。
它会把人类视频中的每一帧,以及机器人执行中的每一步,都转换到同一个向量空间,再寻找两者在任务进度上的对应关系。
可以把它理解为:机器人不必在执行到第5秒的时候,只参考视频第5秒,而是先判断自己做到了哪一步,再找到视频中最匹配的画面。

根据自变量公布的结果,这种方法让任务进度的时间对齐误差降低了一个数量级。即使某一步变慢,机器人也能按照自己的节奏继续完成任务。

HOST的核心是一个带有视觉预测能力的级联策略模型,采用双专家MoT架构。
通俗来说,它像两个分工不同的大脑。“视频专家”负责看懂画面、判断任务进度,并预测接下来可能出现的结果;“动作专家”负责把预测出的结果转化为机器人动作,并控制执行。
在训练阶段,HOST分为“同体预训练”和“人机视频训练”两个阶段。
第一阶段是同体预训练。机器人先学习机器人自身执行任务的视频和轨迹。它要学会看到当前画面后,预测下一步会出现什么结果,也要学会为了达到这个结果应该怎样行动。第二阶段是人机视频训练。模型再学习人类演示视频,把人类完成任务的过程转换为机器人视角下的目标结果,再根据目标结果生成动作。
需要说明的是,HOST并不是完全不训练。模型在正式使用前,仍然要完成基础预训练。真正变化的是:模型训练完成后,权重会被冻结。机器人学习某个新技能时,不再为这个技能重新微调,而是在推理过程中通过视频获得技能。
在自变量公布的实验中,HOST只看一段平均29秒的人类视频,复现新技能的成功率达到62%。
作为对比,Vid2Robot和AWDA同样从单段视频中学习技能,成功率为19%。Pi-0.5结合微调的方案,需要50个机器人任务示范,并进行约4小时微调,成功率为38%。
按照这一对比,HOST只需要Pi-0.5微调方案1/50的数据样本量和1/500的学习时间,成功率则高出24个百分点。

这组数据背后,反映的是技能开发成本的变化。
微调模式下,增加一个新技能,通常要重新设计流程、采集机器人示范、筛选数据、训练模型,再进行测试和调试。如果效果不好,还要补充数据重新训练。
HOST则尝试把这一过程压缩成一段人类演示视频。一个会做这项任务的人,只要做一遍给机器人看,就可能把技能教给机器人。用户不需要理解模型,也不需要记录关节轨迹。
当然,62%的成功率也说明HOST仍有提升空间。看一次视频就学会技能,并不等于机器人已经能稳定掌握所有复杂任务。
但它证明了一点:机器人学习新技能,不一定只能依赖反复修改模型参数。视觉理解和推理,也可能成为更高效的技能获取方式。
微调还有一个常见问题:学习新技能时,旧技能可能受到影响。
因为微调会直接修改模型参数。新数据不断改变模型内部能力,有时会让模型更擅长新任务,却削弱原有能力。自变量公布的结果显示,Pi-0.5结合微调的方案学习新技能后,过去技能的保留率只有17%。
HOST的技能学习发生在推理阶段,不会因为某个新任务修改模型权重。
在这种模式下,演示视频更像一本可以随时调用的“菜谱”。机器人执行某个技能时,就读取对应视频。更换任务时,则调用另一段视频,不必重新训练模型。
HOST还测试了50个包含不同物体、工具和基础动作的任务,均展现出学习新技能的能力。
当光照、物体、场景和位置发生变化时,HOST的成功率仍保持在50%以上。即使执行过程中物品被移动,机器人也能调整动作继续任务。

这说明它不是单纯背下一套固定轨迹,而是在结合当前状态和目标规划下一步动作。
HOST对家庭机器人的意义尤其明显。
家庭不是标准化生产线。每个家庭的物品、空间和习惯都不同。即使是整理桌面、叠衣服、收纳杯子,也可能有完全不同的要求。这些任务数量多,而且很难提前穷举。

如果机器人每掌握一个新技能、进入一个新场景、甚至碰到一个新物体,都需要重新干预与微调,那么它真正进入家庭干活的日子,将被无限期推迟。
更理想的方式,是机器人拥有通用基础能力,同时能够在使用中继续学习。
用户不需要编程,也不需要遥控机器人做几十次标准示范。只要像教另一个人一样,把任务做一遍给机器人看。
HOST正在尝试把这种交互方式变成可能。
当技能教学从“采集数据并微调模型”变成“展示一遍任务过程”,机器人适应不同家庭和不同用户的成本就有机会下降。用户也不再只是从固定菜单里选择功能,而可以通过自然演示,帮助机器人获得新的工作方式。
目前,自变量已经将HOST的论文和代码开源。
真正有长期价值的机器人,不仅要已经会做很多事,还要能在遇到新任务时,看懂人类的意图,并快速学会新的做法。
HOST距离这一目标仍有继续优化的空间。但它已经展示了一种可能:一段数十秒的人类视频,可以直接成为机器人学习新技能的材料。
当机器人开始通过观察理解任务,而不是只靠一次次微调记住动作,具身智能距离真实生活,也就更近了一步。
格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。


