打通数据采集加工交付全链路闭环 北京人形誓做行业数据底座

4 小时前5.8k
北京人形要为全行业装上“风火轮”。

微信图片_20260904193351_2092_5.jpg

出品 | 创业最前线

作者 | 林岩

编辑 | 闪电

美编 | 邢静

审核 | 颂文

前不久的世界人形机器人运动会上,天工机器人像脚踩了风火轮,以8.64秒夺冠并改写人形机器人百米纪录。

这个风火轮最重要的是什么?其实就是数据。没有海量、精准、高质量的实操训练数据喂出来的“肌肉记忆”,天工跑不出这个速度。

北京人形把这项数据业务比喻做“天工风火轮”。风火轮的核心是“转”:让数据高速稳定持续滚动,才能转出产业加速度。

但当下具身智能行业正撞上一堵墙:截至今年7月,国内真实物理交互场景数据不到50万小时,而机器人商业化落地需要至少数千万小时数据,缺口超99%。李飞飞今年在访谈中直言,机器人面临极其困难的问题,就是非常缺乏数据。

大模型喝的是“自来水”,互联网上数十年积累的文本、代码、论文,爬下来就能用。机器人喝的却是“瓶装水还得自己灌”,每一条数据,都要让机器人在真实物理世界里亲手做一遍,贵、慢、还容易坏。

普遍缺数据的当下,天工的风火轮为什么能转?答案藏在原料、加工、交付的运转逻辑里。

1、数据原料从哪来?三条路各有利弊,北京人形“全都要”

原料是风火轮的第一步,但行业普遍卡在这里。

要攻克数据荒,行业有三条主流路线,不过都有各自的天花板。

仿真合成:在虚拟物理世界里批量生成机器人操作数据。优点是成本极低,可无限生成,能覆盖各种危险或难以在现实中复现的场景。但Sim2Real鸿沟是一道绕不过去的坎。斯坦福HAI今年发布的《AI Index Report 2026》显示,机器人在仿真环境中的操作成功率高达89.4%,迁移到真实家庭场景骤降至12%,落差高达77个百分点。

无本体Ego/UMI:采集人类第一视角的操作视频和数据。具备规模大、成本低的优势,人类每天都在拿东西、开门、做饭,本身是个巨大的数据矿。但致命短板是缺本体反馈:机器人不知道“这样做的时候关节用多少力、夹爪抓的多紧”,无法直接训练真机策略。就像看了一万遍别人游泳的视频,自己不下水还是学不会。

真机遥操作:人通过VR头显和遥操设备远程操控真实机器人完成任务,同步采集动作与环境数据。数据质量最高、对齐度最强,完整保留了物体材质、摩擦力、重力、环境扰动等真实物理变量,是真机落地的决定性数据。但弊端是硬件成本高,一台机器人几十万;人力成本高,操作员全天候值守,单小时有效数据成本500-1000元;规模化困难,一台机器人24小时不停,一次操作10秒,采满一千万次要三年多。

图片

面对三条路线各自的利弊,北京人形的数据解法是不押注单一路线,而是矩阵式采集“全都要”。

它在自主搭建的6000㎡基地里布局了行业最全的五大数据采集技术形态:光学动作捕捉、无本体Ego/UMI采集、真机遥操作、远程遥操、仿真合成,构建了“真机数据定基准、无本体便携示教扩规模、仿真合成补长尾”的三维数据体系,以真机原生交互数据锚定机器人本体的操作精度底线,依托无本体人类示教快速放大日常场景数据的覆盖广度,最后用仿真环境定向生成极端、危险、低概率的长尾场景样本,形成“高精度-大规模-全场景”的完整数据闭环。

基地内,150余种本体采集设备,40种不同构型的机器人,以及近百台无本体虚拟设备同步采集数据,年数据产能可达18万小时。

数据数量大,质量也很关键。基地内,布置了家居、商超、工业装配、特种作业等40余个模拟实景分区。旗下100套无本体采集设备还部署至全国真实工厂和家庭,常态化、真实化采集,让数据采集长在真实场景里,采的是机器人未来要面对的真实工况。

图片

图片

解决数据从哪里来这一问题中,北京人形做到了两个全国“第一”——场景覆盖数量全国第一、机器人本体构型行业第一。这意味着,它能采的场景比别人多、能用的机型比别人全、采取的数据更为真实。

通过矩阵式采集,北京人形实现了数据原料的丰富,完成了风火轮的第一步:原料要备齐、要纯。

2、数据怎么加工?行业唯一跑通全链路闭环

原料备齐了,怎么把“生数据”变成“熟数据”?这一步才是真正的分水岭。

行业正在形成一个共识:本体和算法不是壁垒,数据闭环能力才是壁垒。算法可以写、本体可以造、算力可以买,但“数据采集—清洗—智能标注—质检—模型训练—模型评测—模型部署—难题回流”的全链路能不能跑通、能不能跑出效率,才是真正的竞争关键。

传统模式下,数据生产是人力密集型工作。标注靠千人级团队手工标注,对着视频一帧一帧标物体、标动作、标语义,一条数据标注成本10-50元;质检靠人眼抽检,漏标、错标难以发现;交付靠人手工搬运,从A系统导出再导入B系统。

更大的隐患是:大量团队把数据采集等同于拍视频扫点云,却忽略了力矩、姿态、接触力、打滑临界等本体与物理环境交互的运动数据。大语言模型可以只靠文本涌现能力,但具身智能必须在与物理世界的互动中学会理解重力、摩擦、碰撞、形变。没有物理交互的数据,是不完整的具身数据,只靠视觉和点云训练出来的机器人,或许能看懂世界,却永远无法走进世界。

北京人形做了一件行业还没有第二家做到的事:把全链路闭环跑通了,成为行业唯一具身智能数据全链路闭环能力的平台。

闭环的关键是做到每一环都自动化、标准化:云端自动处理管线边采边传、24小时不间断,白天采集夜间即可完成处理;AI大模型智能标注替代千人级人工,仅需少量人工校验,覆盖2D、3D点云、时序、语义等全类型标注需求,支持三维二维联动;三道质检(采集一检、标注二检、伙伴验收三检)兜底质量,配合质量评测平台和可视化平台,实现异常case快速定位、模型效果量化评测;处理完一键自动交付至指定云端存储,无需人工介入。

这一套组合拳,使得北京人形的数据生产效率提升50%以上,综合生产成本缩减30%以上。

数据加工全链路闭环,让北京人形机器人的工具链完备度稳居行业第一。没有自动化生产管线、智能标注体系与三道质检机制的支撑,再海量的原始数据也只是沉睡在仓库里的无效资产。

不过,闭环跑通了,只解决了“效率”问题。还有一道更关键的题:数量重要,质量更重要。行业早期,资本市场很容易用“累计多少小时数据”作为核心评判指标。但经过一轮实践,市场发现盲目采集一百万小时并不难,但这样任务场景单一、数据同质化的数据几乎没有价值。

工信部今年批准发布首份行业标准《人工智能关键基础技术具身智能数据集质量要求及评价方法》,涵盖完整性、一致性、多样性、真实性、易用性等质量维度,2026年11月将正式实施,这标志着行业从“规模导向”转向“质量导向”。对于头部玩家来说,标准既是门槛,也是护城河。

质量维度里,最反直觉的一条:错误数据可能比正确数据更值钱。场景落地中冒出来的异常case:抓取失败、姿态偏差、工具打滑、物体掉落,这些“失败经验”的回流迭代效率,才是决定模型优化速度的关键。这跟自动驾驶踩过的坑一模一样:99%正常行驶没有信息增量,1%的edge case(边缘案例)才是真金。

北京人形把这叫“难题回流”,数据不是采完就完,而是要把异常case精准回流到训练端,让模型在犯错的地方反复练,练到不出错为止。这是数据飞轮里最核心的一环,也是大多数数据采集方还没有意识到的一环。没有难题回流,数据只有一次性价值;有了难题回流,数据才能真正发挥价值:每一次犯错都在为下一次不错提供养料。

3、数据交付到哪?对内造血,对外赋能

风火轮转起来,数据往哪去?

北京人形既内部使用,更开放给行业。对内,数据直喂天工,满足企业自我造血。值得一提的是,这种造血是在真实场景中,而非实验室。

赛场之上,天工机器人8.64秒夺冠、举重项目包揽前四名,源自基地采集的跑步、举重、障碍赛等动作数据,有效支撑了天工的竞技突破。赛场之外,基于基地采集的物流分拣数据训练的模型,已在顺义京东物流分拣厂投入实际运行:机器人在真实的快递分拣线上干活,而不是在实验室里分拣标准的快递盒。

北京人形从采集到训练到部署都在真实工况中跑通,这不是训练场满分、现场失灵的“伪闭环”,是保障风火轮真正踩实的真闭环。

对外,北京人形将全栈能力赋能行业伙伴,避免重复造轮子。目前,天工风火轮已服务多家具身智能头部企业,覆盖行业核心参与主体。联动百余家外部数采厂,将自研平台能力对外赋能。目前,其已支持SaaS服务与私有化部署两种模式,合作伙伴可以按需选用。其交付至行业伙伴的数据验收通过率达95%以上。

在交付端,北京人形也实现了三个“第一”:开源数据集下载量行业第一、合作伙伴规模全国第一梯队、高质量真机数据交付规模全球第一。它们共同回答了一个关键问题:数据做出来了,有没有人用、用不用得起、用了能不能落地。

风火轮之所以能越转越快,不只靠技术和产能,还有两个根基:标准和合规。作为国家队,北京人形联合工信部制定数采场建设、数据采集标注、高质量数据集相关行业标准,把标准嵌入采集/质检/交付全流程,让行业有据可依。在其操作过程中,已经做到来源授权、全程脱敏、安全流通、可溯可查,数据全链路血缘追溯、版权合成覆盖,配套权限审批、操作日志留痕机制,让数据在合规框架下跑起来、不失控。

标准和合规不是限制,是让风火轮转得更稳、更久的轴承。没有标准的行业,数据交易靠私下协商,质量参差不齐,伙伴不敢用、生态建不起来;没有合规的数据,来源不明、隐私不清,一旦出事整个飞轮停摆。

这些都是北京人形作为国家队应当承担的责任,而其也在朝着这个方向前进。目前,其开源数据集RoboMIND全球下载量突破2000万,未来还将搭建行业数据联盟实现资源共享,目标是打造全球首个百万小时高质量具身智能数据平台。

4、结语

据IT桔子统计,2026年上半年25家中国具身智能数据创业公司合计拿到超过170亿元融资,数据采集需求占人形机器人订单比例从2025年的31%预计突破50%。资金正在从“造机器人”转向“喂机器人”。在LLM时代Scale AI靠数据标注跑出独角兽估值,在具身智能时代物理数据无法爬取、必须在物理世界采集,全链路数据闭环的壁垒远高于文本标注。谁先跑通,谁就是这场淘金热里最稳的“铲子商”。

不过,北京人形不以数据业务逐利为核心,作为国家队,其更在意做大行业生态。天工踩着风火轮跑出了8.64秒,北京人形要做的是让机器人行业踩上风火轮。

当数据原料备齐备纯、加工闭环运转、交付通且稳、标准管住、合规托底,数据飞轮就会越转越快,整个行业才有望打破数据荒,越来越多机器人将踩上风火轮。


格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。

App内直接打开
商务、渠道、广告合作/招聘立即咨询

相关文章

海尔智家IFA:从家电第一到智慧家庭第一的跃升

节点财经 · 昨天 20:34

cover_pic

150万亿美元!钱越来越多,为什么我们却感觉越来越缺?

独行侠 · 昨天 20:28

cover_pic

800亿美元!全球最大主权财富基金拟减持美债

山顶的太阳 · 昨天 19:35

cover_pic
我也说两句