外滩大会三问具身智能:模型、数据、生态如何突围?
21世纪经济报道记者 董静怡
2026年,具身智能已经走出实验室的玻璃房。
行业报告预测,今年全球人形机器人出货量将达到6.25万台,同比增幅接近247%,中国厂商占据绝大多数份额。
在刚刚结束的外滩大会上,机器人不再只用来跳舞表演,药房里的分拣机器人穿梭在80厘米窄货架间完成夜间分拣;在工厂产线上,机械臂承接小件上料、纸箱拆垛;在医院场景中,康复机器人日复一日辅助病患肢体训练。资本、政策、供应链集体向这个赛道倾斜。
但热闹背后,行业还没有从样板点走向规模化复制。大量样机停留在展会演示,一次完美的Demo可以靠反复调试拿到,但换到另一家门店、另一套产线,成功率便断崖式下滑。
在外滩大会举行的“基座之上:具身智能的场景突围与协同进化”论坛上,多位具身智能领域的科学家、数据专家与企业CEO共同探讨了行业现状和卡点。
他们认为,行业热度之下,技术路线没有收敛,高质量物理数据供给不足,能够规模复制的产品形态和商业模式也还在探索中。
模型:告别路线之争,回归能力本身
过去一年,VLA、WAM的路线之争占据了具身智能行业大量讨论篇幅。
一部分团队选择在成熟的视觉语言大模型之上做改造,把数字世界的能力迁移到机器人;另一部分押注世界动作模型,强调对物理环境的推演预测。两种方案都产出过不少惊艳的演示视频,但落地到真实多变的物理环境,两套路径都暴露出明显短板。
蚂蚁灵波首席科学家沈宇军在圆桌论坛上直言:“上半年大家一直在争论做VLA还是做WAM?站在现在这个时间点往回看的时候,感觉那时候之所以会有技术路线之争还是因为大家过于想走捷径。”
VLA、WAM本质上是把已有的VLM多模态模型、视频生成模型迁移到机器人任务上衍生出的概念名词。数字大模型接收的是对话式的输入,而物理世界机器人面对的是源源不断涌来的传感器数据流:视觉、力觉、空间位移等,且环境时刻发生变化,这是两套完全不同的信息范式。把现成数字模型拿来做二次微调,短期可以快速做出亮眼Demo,却绕不开物理世界独有的难题。
香港中文大学校长特聘助理教授薛天帆补充了另一重现实约束。语言大模型可以在统一模态下完成训练迭代,具身智能却做不到。不同机器人本体传感器配置千差万别,灵巧手、轮式底盘、人形躯体硬件差异巨大,模态很难统一。
同时,评测体系严重缺失,不像计算机视觉有大量标准化公开数据集,真机测试成本极高,很难公平横向比对各家模型真实能力。各个模块互相牵制,单一模块单点突破,很难带来整体质变。
对此,行业普遍认为,具身模型还是要从机器人需要什么能力出发,而非从已有工具出发。
沈宇军把机器人大脑拆解为三项底层工作:从传感器原始信号生成高质量Token;完成多模态信息的对齐融合;基于全部观测输出可落地执行的动作。这三件事对应的感官、神经信号传导、动作输出逻辑,是现有大语言模型没有接触过的领域。
“沿着借用数字模型那条路走有短期价值,但走到最后,有一些门槛一定要跨过。”沈宇军说。
刷榜、跑分、演示之外,行业还需要一套面向真实物理世界的评判标尺。
沈宇军提出一个设想:“把机器人带上模型,在这个会场通上电,跟所有的人接触,要能待满一整天不出问题。”
这个标准看似简单,背后却是对泛化性、安全性和长程任务能力的综合考验。“如果这件事情做不到,它只能是在某一个特定场景或封闭场景待着的话,谈通用还太远。”沈宇军表示。
数据:真正稀缺的不只是“量”
“具身智能缺数据”是整个行业最高频的共识。但行业普遍认为,当下高质量的数据更为重要。
蚂蚁灵波首席数据科学家黄用韬将数据质量拆解为两个层面。第一层是工程底线:视频是否掉帧、画面是否失真、多传感器时钟是否同步。这是硬门槛。
第二层则和训练目标强绑定,不存在放之四海皆准的“黄金数据集”。做轨迹平滑度训练,需要轨迹收敛统一的样本;做泛化训练,则需要物体位置、形态高度发散、多样化的样本。
这也回应了行业一个普遍担忧:如果行业都采购同一套公开数据集,会不会造成各家模型能力趋同?业内普遍判断风险有限。
一方面,企业不会只采购单一来源数据;另一方面,原始数据只是原材料,每家企业的筛选策略、预处理、训练配比千差万别。如今产业趋势也从采购成品数据集,转向定制化采集,进一步扩大各家的差异。
当前,供给端已经在加速。中国信息通信研究院的报告显示,截至2026年6月底,全国建成启用超过70家具身智能训练场,在建或规划中的还有46家。但报告同时指出,训练场面临“场景任务同质化、数据实际产能有限、数据多样性和流通性不足”等共性挑战。
黄用韬表示,绝大部分机器人仍用于科研、数采或商业表演,真正进入工业化生产或服务行业的极少。机器人在真实场景中的数量太少,数据飞轮的“回流”环节几乎是空的——采集、训练、部署、反馈的闭环,目前只完成了前半段,数据飞轮至今没有真正转起来。
那到底什么信号,才代表具身智能的数据飞轮真正转起来?黄用韬判断,是当行业不再疯狂做加法,开始学会做减法的时候。
今天行业还处在“生怕漏掉任何一条数据”的阶段,飞轮成熟的标志,是大家能够清晰分辨哪些样本是无效、冗余、低价值的,敢于大规模删除无效数据,把算力留给真正能推动模型进步的样本,从追求数据数量转向追求数据利用效率。
只谈数据量,不谈分布、质量、使用效率,会持续把行业带入误区。沈宇军也认为,未来两到五年,数据总量大概率不会再成为核心矛盾,真正的难点转向样本筛选、定向补采。
生态:垂直场景先落地,协同进化破局
具身智能是闭门修炼内功,还是直接下场干活?蚂蚁灵波CEO朱兴的回答是:“哪怕当童工,也该干活了。”
朱兴认为,模型的泛化能力、数据的积累、安全机制,都还在童年阶段。但正因为是童年,才需要真实场景来学习。
不过,落地不等于能直接奔赴全场景。最大的阻碍之一,是复制成本居高不下。同一个机器人方案,跑通第一家药房、第一个工厂工位,再复制到第二家,环境SKU、布局发生变化,往往要投入高额二次适配成本。泛化不足,直接限制商业化复制,账算不过来。
行业形成共识,通用人形机器人直接杀入家庭的叙事过于乐观。更现实的路径是优先选择环境相对可控、任务长度有限的垂直场景——如工业物流、药房分拣、康养辅助——先把局部场景打透,一边产生商业价值,一边积累真实数据,再逐步向外拓展能力边界。
产业一线已经出现小批量落地的样本。乐聚机器人联合创始人兼CEO常琳介绍,家庭消费级通用机器人距离大规模普及尚需时日,但工业场景已经出现客户愿意付费采购的项目。汽车零部件小件上料、工厂纸箱拆码垛,机器人承接重复性岗位,缓解工厂招工难的问题。
傅利叶创始人兼CEO顾捷回顾,早在“具身智能”这个名词火爆之前,康复机器人就已经批量走进医院,辅助中风、帕金森患者做肢体康复训练。客户并不关心背后是传统编程还是大模型驱动,只看疗效、安全性以及商业账能不能算过来。To B封闭可控场景,依旧是未来三五年产业的主战场。完全非结构化的家庭全场景通用机器人,还有很长的路要走。
无论To B还是To C,单凭任何一家企业,很难把全链条全部吃下。整场论坛反复提及“协同进化”,具身智能是典型的复杂系统工程,包含场景方、模型厂商、本体硬件、芯片、零部件、数据服务商,链条极长,过去行业出现过“全栈通吃”的思潮,但经过两年实践,越来越多企业选择回归自己的生态位。
朱兴表示,蚂蚁灵波定位聚焦机器人大脑,不会试图去做本体大规模量产、全流程场景定制。“我们何德何能比专业的数据商做好大规模场景进入,何德何能做本体大规模的量产并且控制好供应链的成本,这些不是我们擅长的。各家做好自己擅长的部分,互相配合。”
大晓机器人董事长、商汤联合创始人王晓刚表示,模型与数据密不可分,数据来源于真实业务场景;本体硬件需要适配模型;场景方输出真实业务需求。四者必须形成闭环,研发迭代效率才能真正提高。
具身智能的规模化,不是所有公司选择同一种模式,而是让各自擅长的能力真正连接起来,在真实场景中创造真实价值。
(作者:董静怡 编辑:张星)
南方财经全媒体集团及其客户端所刊载内容的知识产权均属其旗下媒体。未经书面授权,任何人不得以任何方式使用。详情或获取授权信息请点击此处。

