自回归 Joint WAM 概览#
自回归怎么理解#
自回归的英文是 Autoregressive。最直观的理解是:每一步都根据前面已经生成的内容,继续生成下一步。
语言模型就是典型自回归模型。它写一句话时不是一次性把整句话全部吐出来,而是一个 token 一个 token 地生成:
今天 -> 今天 天气 -> 今天 天气 很 -> 今天 天气 很 好
放到 WAM 里,如果把视觉、语言、动作都表示成 token,就可以用类似方式生成:
当前观测
↓
第一个动作 token
↓
下一个视觉/状态 token
↓
下一个动作 token
↓
...
为什么适合 WAM#
机器人任务天然有时间顺序:
先靠近杯子 -> 张开夹爪 -> 对准杯子 -> 闭合夹爪 -> 抬起
自回归模型很适合表达这种“前一步影响后一步”的结构。它也容易复用大语言模型的能力,因为 LLM 本来就是自回归生成器。
在 Joint WAM 中,自回归路线可以把动作和未来状态组织成一个序列:
观测 token, 指令 token, 动作 token, 未来视觉 token, 动作 token ...
模型要学的就是:给定前面的上下文,下一个最合理的 token 是什么。
优点和局限#
优点:
很适合序列建模,容易表示步骤和因果顺序。
可以自然接入语言模型、多模态 token 和长上下文。
对离散动作、动作 token、视觉 token 的统一建模比较方便。
局限:
一步步生成,长轨迹推理速度可能较慢。
前面生成错了,后面容易被带偏,出现误差累积。
连续动作需要先离散化或设计专门的动作表示。
对多种可行动作的表达,有时不如扩散模型自然。
和扩散式的区别#
一句话对比:
自回归:按顺序写出来
扩散式:从噪声整体修出来
如果任务更强调步骤、语义顺序、token 统一表示,自回归路线很自然;如果任务更强调连续轨迹、多解动作和整体生成,扩散式路线通常更顺手。
小结#
自回归 Joint WAM 更像是 按顺序写出一段行动和未来。
它适合 token 化、多模态序列和长上下文推理,但需要处理生成速度和误差累积问题。