关于具身AI的思考

关于具身AI的思考

综述

近年来,具身智能主要从如下几个方向进行发展:

  • VLM,视觉-语言模型来理解世界
  • VLA,视觉-语言结合人类指令和视觉观测输出来解决目标定位和指令生成
  • VLN,利用视觉在环境中导航
  • WM,学习当前状态 + 动作 → 未来世界状态

些许思考

我们可以观察到,当前具身智能在诸如智能驾驶、机械搬运等触感无关场景表现良好。换言之,对于这些任务,人们更大程度依赖于视觉上的确认并付诸于自由度较小的行动。

但是对于抓取、对抗等需要程度上把控的活动,具身智能至今仍无法很好把握。

因为它能看到物体的移动,甚至经过编码也能够听到物体的声音和语言,但是无法感知环境带来的完整反馈。

或许,至少目前则可以认为,瓶颈很大程度卡在了更高维的触觉感知。

这种数据是难以采集的,根源在与人类的触觉感知结构与机械的感知结构大不相同;语言和视觉数据能被采集和训练或许源于人类通过生物学初步掌握了人脑处理语言、人眼处理视觉的简化方式(又或者是高度标准化的统一技术栈),但是触觉的感知与传感器关联性极强,且目前理论根源并不深厚,因此人们似乎幻想着仅仅通过视觉和听觉就完成对于灵巧机器人的塑造。

当前 VLM/VLA 路线擅长解决“机器人应该做什么”,但对于接触丰富的灵巧操作,“机器人如何知道自己正在怎样接触世界”仍然没有获得与视觉、语言相匹配的统一感知与数据基础。

所谓市场泡沫,以及对于具身未来的质疑或许来源于具身智能本身就充满了过多人类的理想化——理想化的缘由是因为想要充分利用已有的技术去追逐远路的实现,但似乎反而遗忘根本。

比较肯定的一点,在婴儿人脑还未发展、盲人看不见万物、聋人听不见声音的时候,这类群体依然能够凭借感知,完成近范围内的行动——那么这是否证明了当今的方向有种为了使用前沿工具而使用前沿工具的嫌疑?