对话大晓机器人:世界模型上真机,商业化先过三道关
商业化需突破场景泛化、持续作业与规模化三关。
21世纪经济报道记者 雷晨 北京报道
2026世界机器人大会(WRC)在北京举办期间,大晓机器人开悟世界模型研发负责人王飞、研发副总裁刘春晓接受21世纪经济报道等媒体采访,回应了世界模型的数据规模、端侧推理速度、商业化落地进展等问题。
这是大晓机器人首次参加WRC,现场展出了开悟世界模型3.1(Kairos 3.1)、环境式数据采集方案2.0,以及面向即时零售、酒店服务和开放场景的三套行业方案——晓满、晓新、晓途。
受访者认为,世界模型要出现明显的能力涌现,人类第一视角数据可能需要接近千万小时级别。而从技术演示走向真实的商业闭环,必须先过三道关:场景泛化、持续作业和规模化。公司计划今年下半年先完成百万级数据储备。
(图为大晓机器人展台)
数据储备瞄准千万小时级
关于世界模型要解决什么问题,王飞表示:“给定当前看到了什么,以及接下来准备做什么,去推演未来可能发生什么。”
简单说,大语言模型和VLA(视觉语言动作模型)预测的是下一个词(next token),而世界模型预测的是下一个世界状态(next state)。
这样一来,机器人在行动前就能先在脑海里推演多种可能,判断每个动作会带来什么结果,然后挑成功概率最高的方案去执行。
开悟3.1采用理解、生成、预测一体化的架构。视觉图像、文本指令、力触感知、本体运动轨迹等多类信息,通过混合Transformer和共享注意力机制,被压缩进同一个隐空间里进行端到端联合训练。
去年12月,大晓机器人首次提出这一架构;今年3月,英伟达在GTC大会上发布的Cosmos 3也走了同样的方向。王飞认为,这说明行业趋势正在从传统的VLA走向世界模型,底层逻辑从预测下一个词转向预测下一个状态。
与VLA的核心差别在于平行推演。VLA拿到图片和指令后直接输出动作轨迹;世界模型则会同时生成多条候选轨迹,并附带每条轨迹对应的未来5到10秒视频。比如开冰箱门,模型会生成3到5种抓取方式,并在虚拟空间里预演每种方式的效果,再通过评估器打分排序——就算用一种别扭的姿势也能打开门,但代价高、效率低,就不会被选中。
推理速度决定了世界模型能不能真正控制实体机器人。王飞透露,Kairos 3.1是80亿参数(8B)的模型,在英伟达Jetson Thor芯片、BF16精度下,单次推理延迟为百毫秒级。作为对比,π0.5模型约33亿参数,延迟也在百毫秒级;而Cosmos 3 Nano有160亿参数,延迟达到千毫秒级。实时性主要靠自研的KairosRT高性能计算引擎,通过线性注意力、混合精度量化和多流水线并行等技术压缩耗时。
王飞认为,百毫秒级延迟是实现流畅移动、动态避障和精细操作的重要门槛。“如果延迟太高,就会直接影响机器人对环境变化的响应速度,也会影响商业化场景的节拍和成本。”
而要真正训练出这样的模型,关键是数据。
大晓提出三层数据范式:第一层是开放物理世界的视频,从海量真实影像里学习自然规律和运动规律;第二层是以人为中心的第一视角交互数据(即人类自己看到的画面和操作过程);第三层是机器人真机数据,用相对少量真实操作数据,让模型对齐到具体硬件上。Kairos 3.1的训练规模明显扩大:视频数据从约100万条增加到400万条,语言Token规模从约2万亿增至10万亿,场景标签从约1000个扩展到1万个。
近期,海外公司Dyna Robotics用百万小时级真人第一视角数据训练模型,在精度和能力涌现上都有明显提升,业内再次热议这类数据是否也能形成规模法则(Scaling Law)。
对此,王飞表示,大晓的三层范式框架不会变,变化在于各层数据的比例。他判断:“世界模型要出现比较明显的能力涌现,可能不止需要百万小时级数据,甚至可能接近千万小时级。未来一两年,以人为中心的数据占比会显著提高。”
王飞透露,公司从今年下半年开始进行百万级数据规模储备,未来继续向千万级推进,希望通过更大规模的数据和更好的模型,尽快推动具身智能迎来类似ChatGPT时刻的能力跃迁。
产业合作方面,算力侧,大晓与壁仞、沐曦、曙光、辉羲等国产芯片企业做适配优化;本体侧与宇树、智元、众擎、银河通用等厂商合作,用世界模型适配不同硬件。
下一步,公司计划把80亿参数的模型轻量化到20亿参数级别,部署到Jetson Thor、Orin及国产芯片上,同时也向更大参数规模拓展,并打通真机数据闭环,让真实交互数据持续回流,驱动模型迭代。
商业化落地三道关
除了技术,团队还详细介绍了商业化进展。刘春晓透露,公司在WAIC 2026期间发布了晓满、晓新、晓途三套行业方案,分别对应即时零售、酒店服务和开放场景自主作业。“我们认为这几个场景里,行业需求和当前技术能力已经形成了比较好的匹配。”
但真实业务中有更棘手的问题——长期作业一定会遇到意外情况(corner case)和单次执行失败,所以方案必须有自我恢复能力。刘春晓说: “这种状态判断、自我纠错和恢复能力,是机器人真正进入无人化长期运营必须具备的能力。”
他进一步指出,大多数演示(Demo)都是在受控环境里、针对有限物体展示最理想状态,但真正落地至少要过三关:
第一,场景泛化。不同便利店的布局、货品和操作要求都不同,模型要能适应变化;
第二,持续作业能力。真实业务要把下单、拣选、打包、交付整个流程闭环起来,远不止抓一下、放一下这种单点动作;
第三,规模化能力。单店、单台机器人表现好不够,推广到多店、多台后,系统一致性必须保持。
具体怎么纠错?他给出的答案是平行推演加反思:“执行前,模型会基于当前观测在平行空间里比较不同策略,选择行动代价更小、预期收益更高的方案;执行之后,如果真实结果和预期不一致,失败数据会及时回到模型更新状态。
下一次推演时,模型首先要知道‘我刚才失败了’,还要知道失败发生在哪里、应该怎样规避,再调整下一步策略。对于大规模真实落地来说,这种持续纠错和恢复能力是必须解决的问题。”
数据配比方面,刘春晓介绍,公司先训练基模(基础模型),落到即时零售、酒店等具体行业后,再用几百到几千小时的行业数据做适配。基模训练遵循三层数据范式,目前仿真合成数据用得不多。
他认为,人类第一视角数据更容易大规模获取,未来会成为训练主力,用这些数据训练基模,是让模型从人的行为中学到人为什么会这样与环境交互,落到具体应用时,再结合机器人本体形态和任务需求,用少量真机数据做最后一层对齐。
(作者:雷晨 编辑:李新江,张明艳)
南方财经全媒体集团及其客户端所刊载内容的知识产权均属其旗下媒体。未经书面授权,任何人不得以任何方式使用。详情或获取授权信息请点击此处。

