自回归 Joint WAM 概览#

自回归怎么理解#

自回归的英文是 Autoregressive。最直观的理解是:每一步都根据前面已经生成的内容,继续生成下一步

语言模型就是典型自回归模型。它写一句话时不是一次性把整句话全部吐出来,而是一个 token 一个 token 地生成:

今天 -> 今天 天气 -> 今天 天气 很 -> 今天 天气 很 好

放到 WAM 里,如果把视觉、语言、动作都表示成 token,就可以用类似方式生成:

当前观测
   ↓
第一个动作 token
   ↓
下一个视觉/状态 token
   ↓
下一个动作 token
   ↓
...

为什么适合 WAM#

机器人任务天然有时间顺序:

先靠近杯子 -> 张开夹爪 -> 对准杯子 -> 闭合夹爪 -> 抬起

自回归模型很适合表达这种“前一步影响后一步”的结构。它也容易复用大语言模型的能力,因为 LLM 本来就是自回归生成器。

在 Joint WAM 中,自回归路线可以把动作和未来状态组织成一个序列:

观测 token, 指令 token, 动作 token, 未来视觉 token, 动作 token ...

模型要学的就是:给定前面的上下文,下一个最合理的 token 是什么。

优点和局限#

优点:

  • 很适合序列建模,容易表示步骤和因果顺序。

  • 可以自然接入语言模型、多模态 token 和长上下文。

  • 对离散动作、动作 token、视觉 token 的统一建模比较方便。

局限:

  • 一步步生成,长轨迹推理速度可能较慢。

  • 前面生成错了,后面容易被带偏,出现误差累积。

  • 连续动作需要先离散化或设计专门的动作表示。

  • 对多种可行动作的表达,有时不如扩散模型自然。

和扩散式的区别#

一句话对比:

自回归:按顺序写出来
扩散式:从噪声整体修出来

如果任务更强调步骤、语义顺序、token 统一表示,自回归路线很自然;如果任务更强调连续轨迹、多解动作和整体生成,扩散式路线通常更顺手。

小结#

自回归 Joint WAM 更像是 按顺序写出一段行动和未来

它适合 token 化、多模态序列和长上下文推理,但需要处理生成速度和误差累积问题。