“特训学堂”为具身智能加注“数据燃料”

新华财经
2026-10-09 07:22

来源:新华财经

“特训学堂”为具身智能加注“数据燃料”

在占地近6000平方米的北京人形机器人创新中心里,家居、商超、工业装配、化学实验室、康养护理等模拟实景分区排布,构成一座面向人形机器人的“实景实训工厂”,源源不断产出高质量数据。

新华财经北京10月9日电 走进北京人形机器人 创新中心(以下简称“北京人形”)具身智能机器人 数据与训练基地,映入眼帘的是一间间特殊的“教室”。在这里,分拣快递、折叠衣服、抓取药品……40种构型各异的机器人 伫立在不同的操作台前,在数据训练师的遥控下反复练习。每一个动作都被传感器精准捕捉记录,并转化为机器人 深度学习的训练样本。机器人 想要认识世界、理解世界,需要大量来自真实世界的数据“教材”。在这个占地近6000平方米的基地里,家居、商超、工业装配、化学实验室、康养护理等模拟实景分区排布,构成一座面向人形机器人 的“实景实训工厂”,源源不断产出高质量数据。

在物流分拣的场景里,一台机器人 正在学习分拣传送带上的物品,将其准确抓取并放置到指定位置。机器人 身后的数据采集员穿戴采集设备,反复完成姿态调整、抓取物件、分拣放置等各类实操动作。旁边的电脑屏幕上,一连串运动轨迹数据同步跳动、实时回传。

“一些看似简单的动作,实际上要应对物体软硬程度、表面摩擦力、空间距离、环境光照变化等大量动态变量。”北京人形数据与训练基地项目经理刘磊介绍,数据采集员并不是在重复同一套演示动作,而是在目标物体的形状、颜色、数量、位置以及背景等多种因素随机组合、不断变化的场景中反复采集演示数据;机器人 也不只是通过遥操作进行模仿学习,还需要感知环境,学习并记忆人类的行为习惯。每一次成功的抓取、每一个失败的调整,都被完整记录。

数据采集只是第一步。海量原始数据汇入“慧思开物”平台底座,经过清洗、标注、校验、质检等一系列加工环节,沉淀为标准化样本,服务于算法模型迭代训练。

基地不仅搭建了模拟实景,还建设了约200平方米的专业光学动作捕捉场地,为机器人 的拟人化动作提供了高精度的采集环境。在今年举办的第二届世界人形机器人 运动会百米决赛中,天工Ultra跑出8.64秒这一超越人类百米世界纪录的成绩,背后离不开高精度数据的支撑,它们帮助机器人 学会更加流畅、自然的肢体语言。

目前,基地已对外交付近3万小时高质量数据,并打通了从数据采集、清洗、质检、标注到模型训练、真机评测、模型部署、数据回流的完整闭环链路。

“具身智能产业浪潮袭来,高质量数据成为其迭代升级的核心燃料。”北京人形数据部产品及项目负责人史明威表示,一万小时高质量数据,可能比一百万小时重复数据更重要。依靠这些高质量数据,大模型不仅能够习得人类动作规律,还可以逐步掌握任务理解、动作规划与自主执行能力,推动机器人 持续迭代升级,由被动执行指令,加速向可自主感知、自主决策的智能体转型。

采集的数据价值,还在于开放共享。2025年12月,北京人形面向全球开发者开源开放具身智能数据集RoboMIND,在一个月内全球下载量实现翻倍增长,目前全球下载量已突破2000万次。

史明威说,此前很长一段时间里,国内人形机器人 赛道面临高质量具身数据稀缺、各家数据格式不统一、数据生态碎片化等难题,不少企业需要投入高额成本自建采集体系。RoboMIND的开源,正在打破这道数据壁垒。

中国信息通信研究院近期发布的《具身智能训练场研究报告(2026年)》显示,全球可用的高质量真实数据仅为数十万至百万小时级,而机器人 要迎来“ChatGPT时刻”,则需要千万小时级的真实数据,供需之间存在量级差距。截至今年6月底,全国共建成启用超过70家具身智能训练场,在建或规划中的训练场有40多家。

史明威表示,基地长远目标瞄准产出百万小时级“高价值、高可用、可论证”的人形机器人 交互数据,同时将数据的标准与合规作为“护栏”,保障数据资产安全可用、可流通,让数据飞轮推动具身智能产业加速迭代。

编辑:尹杨

声明:新华财经(中国金融信息网)为新华社承建的国家金融信息平台。任何情况下,本平台所发布的信息均不构成投资建议。如有问题,请联系客服:400-6123115

分享至:

微信

微博

(来源:新华财经 编辑:张明艳)