蚂蚁灵波
-
蚂蚁灵波不“嫁接”:具身大脑的原生路线与冷启动
过去一年,具身智能最热闹的争论,不是某个模型的效果有多好,而是一个悬而未决的路线问题:机器人到底该走 VLA,还是走 WAM?两种路线看似针锋相对,内核却指向同一个出处,都建立在数字世界的大模型之上。VLA 是视觉语言模型向动作的延伸,WAM 则把视频生成模型搬到机器人身上。 行业争论的 VLA 和 WAM 两条路线,灵波都没有选。它走的是第三条,官方称之为“具身原生”:从零训练自己的基模。 8 月,这家蚂蚁集团旗下的具身智能公司宣布启动首轮融资。9 月 11 日,在 2026 外滩大会,CEO 朱兴与首席科学家沈宇军在多个场合重复了一个判断:具身智能不是数字智能的嫁接,必须基于物理真实数据。 VLA 和 WAM,都是数字世界的延伸 朱兴对技术路线之争的评价是,大模型厂商只有两类工具可用,一类是多模态视觉语言模型,一类是视频生成模型,VLA 和 WAM 不过是“在已有工具之下解机器人问题想出来的名词”。按照沈宇军的说法,这些路线都有点儿“过于想走捷径了”。 灵波其实自己尝到过走捷径的代价,它的 1.0 系列曾是微调数字世界通用视频生成模型 Wan 的结果,硬调出来适配机器人,被朱兴称为“撞到了南墙”。第一,数字模型有上限;第二,微调到最后,反而会破坏原模型的先验和知识,副作用是泛化性降低。 “非要让一个数字世界模型去控机器人,特别像非要求一个男人生孩子。”朱兴说。 这个判断有一个现实参照。GPT-6 出现后,业内一度讨论它对具身的冲击。朱兴认为,凡是基于数字世界模型做具身任务的公司,都会觉得“很恐怖”,因为基模能力一旦跃迁,基于它的下游工作就可能失去意义,这就像两三年前做后训练的那拨人,会随着基模从 60 分跳到 90 分而焦虑。 灵波对路线之争“很少讨论”,朱兴认为,从宏观设想出发的争论没有意义,有意义的是先想清楚模型要具备什么能力。 它把机器人抽象成三件事:从传感器源源…