“一脑多用”双场景落地,自变量想成为“具身界的OpenAI”
来源:第一财经
今年世界机器人大会上,具身智能企业围绕实际应用场景展开的展示,几乎已经成为行业标配。
本届大会上,自变量将家庭与物流两个差异鲜明的应用场景呈现在展位上:家庭场景中,机器人完成整理衣物、铲猫砂、套垃圾袋等日常任务;物流场景中,两条机械臂协同夹爪,面对随机摆放的包裹完成快速分拣,并将快递面单逐一翻转朝上。
据自变量介绍,这两个场景并非停留在展示阶段,而是已经实现真实落地。其中,进入家庭提供服务的机器人已入选APEC官方示范案例集;物流场景则已经部署至真实产线,实现7×24小时运行。支撑两个场景的,是同一个基础模型WALL-B。
在大会主论坛演讲中,自变量创始人、CEO王潜表示,“具身智能需要的不是把语言模型或多模态模型‘搬’到物理世界,而是一个平行于数字世界基础模型的、专门服务于物理世界的‘基础模型’。”
打造通用具身智能是自变量的目标。在技术路线尚未完全收敛的阶段,自变量希望成为“具身界的OpenAI”,实现具身智能领域“从0到1”的突破。
一脑多用:家庭服务验证“广度”,物流分拣验证“深度”
包括自变量在内,多家参展企业都展示了机器人在家庭场景中完成长程任务的能力:人类通过语音下达指令后,机器人能够理解任务需求,并自主完成相应操作。
然而,在整个WRC展区内,自变量是目前唯一一家真正实现机器人规模化进入用户家庭、提供家政服务的企业。
由于环境复杂多变、任务高度碎片化,家庭场景一直被认为是检验具身智能泛化能力的重要场景。公司成立之初,自变量便将这一方向作为重点探索领域。今年上半年,自变量机器人开始大规模地进入真实家庭工作。
王潜在演讲中透露,目前自变量机器人已经服务数百户家庭。“通过和家政平台合作,机器人入户完成钟点工保洁工作。”他介绍,目前仍有部分机器人长期驻扎在用户家中,团队会根据用户反馈持续进行迭代优化。
除家庭场景外,物流分拣也是自变量验证具身智能落地能力的重要方向。
在展台现场,两条搭载夹爪的机械臂协同配合,对随机摆放的包裹进行识别与分拣:普通包裹被快速处理,面对泡沫包裹、玩偶等异形件,机器人也能够完成识别,并将其分拣至另一条流水线。
此前,自变量曾进行机器人夹爪物流分拣直播,实测分拣速度达到1911件/小时。直播过程中,自变量合伙人兼算法负责人甘如饴表示,在真实产线中,这一速度已经超过人类操作效率。
甘如饴介绍,物流行业还有一个重要指标——回流率,用于衡量分拣准确率。这一指标要求机器人不仅能够准确识别异形件,还需要保证整个操作过程的连续性和稳定性。
此外,成本也是物流行业普遍关注的问题。据了解,自变量机器人已经投入真实分拣产线,从方案立项研发,到系统跑通,再到部署应用,整体周期约为三个月。相比之下,海外企业往往需要两年以上。
“相比灵巧手,夹爪成本更低,同时维修也更加方便。”甘如饴表示,依靠强大的基础模型,两指夹爪同样能够完成分拣任务。这是更容易被产线接受、实现规模化产业应用的方案。
值得关注的是,在家庭和物流两类场景中,自变量机器人搭载的均为同一个WALL-B模型。这是一款基于世界统一模型架构打造的具身智能基础模型。
“WALL-B最核心的特点是‘多模态进、多模态出’的统一模型,能够进行端到端预测,同时采用多种模态联合建模方式,从而提升模型泛化能力以及操作成功率。”甘如饴补充道。这个模型原生具备对物理世界的理解,是它能够从容应对各种场景任务的原因。
同一套“大脑”在非结构化、半结构化场景中接受持续验证,也让“一脑多用”从概念逐渐走向现实。
王潜认为,“基础模型能够相比专用模型、专家工程以及单点场景方案,实现更好的效果、更低的成本和更快的速度。”在他看来,这一设想已经进入“现在时”,通用模型路线的产业价值正在得到验证。
“最强大脑”的诞生:来自模型、数据、infra和硬件的闭环
模型能力的提升,离不开高质量数据的支撑。
今年以来,具身智能数据采集成为行业关注热点,多家企业提出百万小时级数据采集目标。但有行业人士指出,数据规模提升的同时,真正有效的数据仍然有限。
在王潜看来,数据并非简单的“原始素材”,而更像是复杂的“工业制成品”。根据团队实践,能够用于模型训练的高质量数据,采集的难度并不低于机器人本体或模型研发,甚至可能更高。
他解释称,“难度主要在于数据加工的链路非常长,定义数据需求、采集、清洗、标注,喂给模型后再根据结果反过来调整数采端,这些都需要大量工作。”
自变量坚持使用高质量、包含真实物理交互的数据。王潜表示,物理过程与动作模态之间存在巨大鸿沟,不能简单复制数字世界的方法获得物理世界的洞察,因此需要从头预训练模型、并依赖包含真实物理交互的数据。
而这类数据成本同样较高。为此,自变量推出了无本体数采设备和系统。据介绍,其采集到的全模态数据支持回放、迁移和模型训练,并支持“无本体+真机数据”的混合训练。同时,自变量还自研了完整的数据管线,覆盖采集接入、数据清洗、智能标注、人工质检、训练评测、模型迭代等环节。
除数据之外,自变量也持续建设“AI Infra”,即支撑模型训练和推理的底层软硬件体系与工具平台。王潜认为,AI Infra将直接影响模型产出的数量和质量。
围绕机器人学习效率提升,自变量推出了多项基础设施能力。今年8月初发布并开源的HOST框架(Human-to-robot One-Shot Skill AcquisiTion,人类到机器人单样本技能获取),能够让机器人仅观察一段数十秒的人类视频,就学习新的技能,同时保留已有能力。
今年7月,自变量发布DMuon优化器,解决了Muon应用于分布式计算时产生的冗余计算和额外通信等系统开销问题。Muon是近两年出现的一种神经网络优化器,通过“矩阵正交化”提升训练效率和收敛速度。
今年6月,自变量发布跨模态具身动作分词器X-Tokenizer,将动作数据“分词”转化为与其他模态数据的对齐问题,使拆分后的动作token具备更明确的语义,从而提升多模态对齐能力和长程任务表现。
这些开源项目只是自变量Infra体系的一部分。从4月到6月短短两个月内,自变量还连续发布了三个具身大模型,包括世界统一模型架构WALL-B、开源VLA模型WALL-OSS-0.5以及世界模型WALL-WM,三个模型均达到世界领先水平,也体现出其AI Infra体系建设的成果。
王潜表示,具身模型Infra并不比语言模型Infra简单,甚至更具挑战。这是因为其中涉及大规模机器人集群,不同硬件体系会带来大量通信和训练方面的特殊问题。然而,这也是让模型保持长期领先的企业根基。
“我们的技术发展快,很大程度上得益于打通模型、数据、Infra到硬件的整个闭环。”王潜相信,在底层Infra支持的模型快速进步下,距离具身智能达到ChatGPT时刻,机器人进入千行百业、千家万户并不遥远。
(来源:第一财经 编辑:张明艳)