爆火的VLA无法实现通用机器人智能

· 2025-09-24 01:02 · 3 阅读

原创 刘洪善 2025-09-24 01:02 广东

好久不写,随便写写

受自动驾驶的影响和启发,在机器人智能/具身智能领域,VLAVision-Language-Action,视觉-语言-行动)异常火爆,风头正盛。但我认为,这条路线存在根本性缺陷,回归可解释、结构化的分层路线,是一个至少十年不变的务实选择。

一、VLA存在的问题的表象

通过最近几篇研究工作,可大致描摹出VLA 存在的问题。

在论文Exploring the Limits of Vision-Language-Action Manipulations in Cross-task Generalization中,作者发现,在简单任务上,如桌面上物体的取放VLA表现良好,但一旦任务复杂度增加(如多物体、3D 空间、动态交互),失败率指数级上升,典型例子包括倒水、叠衣服等,任务成功率接近零

在另一篇研究Vision Language Action Models in Robotic Manipulation: A Systematic Review中,研究者指出,VLA模型普遍存在训练环境过于简化、缺乏动态接触建模、以及任务语言与动作之间结构化映射不足等问题。

在名为ForceVLA的工作中,研究者引入了力反馈等模态,在插拔插头等任务中提升显著,但也暴露了 VLA 在精细控制、触觉感知等方面的不足。

二、VLA存在的更深层次的问题

这些研究表明,VLA 本质还是一种试图模仿大语言模型成功路径、期望依赖大数据加大算力来实现泛化的行为克隆。这种“泛化”,是通过大规模过拟合来实现的表面上的泛化,是一种“暴力搜索”,无真正的智能可言。

首先,随着任务变复杂、环境多样化,数据量的要求指数增长,但模型的提升通常是渐进且不稳定的。机器人任务泛化,需要万亿级演示数据,远超现有已知的数据集规模,成本极高。

其次,VLA难以学到机器人真正需要的物理规律。VLA 视觉+语言 → 动作指令看作一个端到端的黑箱,没有对物理规律(摩擦、重力、碰撞约束)、几何约束(空间变换、物体刚性、物体变形)、力反馈等进行建模,这些物理规律,并不能通过更多的数据与更大的模型学习出来。

最后,也是机器人产品化最难以接受的基本事实,即VLA是黑箱,缺乏中间的监控与控制模块,当模型出错时,难以找到原因。这种不可解释性,在物理世界中是不可接受的。

三、那为何VLA还这么火

你前面说了这么多VLA的不足,那为什么VLA还这么火?

首先,巨头们出于PR、股价等原因,大肆推广。

其次,由于是一个热门的新领域,可多发论文,短时间出来了大量的文章,质量良莠不齐。

再次,VLA继承了大模型的能力,也试图模仿大模型技术路线,让人以为很快也会看到机器人的“ChatGPT”时刻,让人充满想象。

最后,缺乏验证效果的客观基准,使得无论是产业界,还是学术界,摆拍、字研横行,给了民众以不切实际的期待。

这些因素叠加起来,造成了VLA的火热,谈机器人智能、谈具身智能,你很难绕开VLA这个话题。

四、那该怎么办

VLA是理想的端到端的机器人智能,差不多就是AGI的同义词,是我们应该追求的,但短期里没有实现的路径。实现端到端,前提是把分层先做好,这是我10年不变的观点。

首先,分层路线是首要的。要让机器人产业活下来,持续获得更多的人才和资金,沿途下蛋、孵化中间产品是基本方略,而要孵化产品,稳定可靠的分层路线是首选,即感知、规划、执行要分层,而且每一层尽量做到可解释:大脑做规划,但其任务边界要足够明确;小脑做执行,但要对误差敏感且能自我修正;大小脑生成的控制序列是人类可验证、可控制的。

其次,融合结构化、可解释的世界模型,会建模物理规律与几何规则,能预测动作后果,并在内部有清晰可追踪的状态与反馈。比如SWIMDreMa等工作,把部分物理规律与几何结构整合进世界模型里,而不只是单纯的行为克隆。

最后,建立真实可靠的测试基准减少摆拍、字研,包含动态干扰、复杂背景、摩擦、力、遮挡等真实条件的测试基准;鼓励基于真实开放环境的机器人大赛,在真实环境中发现失败案例,锻炼机器人的泛化能力。

五、小结

总之,VLA 模型是一个令人向往的技术方向,它让我们看到了视觉、语言和行动融合的可能性。但另一方面,VLA又存在着很多问题和泡沫,我们不应简单的试图模仿大语言模型的大数据加大算力路径来实现通用机器人智能,而应回到可解释、结构化的路径上来,沿途下蛋,静态花开。

阅读原文

跳转微信打开