Joint WAM 概览#

Joint WAM 是什么#

Joint WAM 强调把 动作未来世界状态 放在一起建模。

在前面的 WAM 概览里,我们把 WAM 理解成:

当前观测 + 指令 + 动作 <-> 未来世界变化

Joint WAM 更进一步,希望用一个统一模型同时生成或预测动作与未来状态,而不是先用一个 world model 生成未来,再用另一个模型把未来转成动作。

为什么会有 Joint WAM#

Cascaded WAM 的结构比较清晰:

先预测未来视觉目标
       ↓
再生成机器人动作

但这种级联结构有一个天然问题:前一级预测错了,后一级很容易跟着错。

Joint WAM 想减少这种断裂,把动作和未来状态放在同一个建模空间中,让模型直接学习:

  • 什么动作会导致什么未来。

  • 什么未来需要什么动作实现。

  • 动作、状态、价值或成功概率之间如何对应。

两种常见生成方式#

Joint WAM 里经常会看到两个词:

  • 自回归(Autoregressive)

  • 扩散式(Diffusion-based)

它们的区别不在于“是不是 WAM”,而在于模型如何生成结果。

自回归方法像语言模型写句子:先生成第一个 token,再根据前面的 token 生成下一个 token。

当前观测 -> token 1 -> token 2 -> token 3 -> ...

如果把视频、动作、语言都表示成 token,那么自回归模型就可以统一地“续写”未来和动作。

扩散式方法像从草稿逐步修成清晰图片:先从随机噪声开始,然后一步步去噪,最后得到一段动作轨迹、未来视频,或两者的联合表示。

随机噪声 -> 粗略轨迹 -> 更合理轨迹 -> 最终动作/未来

简单说:

  • 自回归适合表达顺序推理和 token 序列。

  • 扩散式适合生成连续轨迹、多种可能动作和未来视频。

小结#

Joint WAM 的一句话理解是:把机器人动作和世界变化放到同一个模型里联合生成、联合预测。

它比单纯 VLA 更强调动作后果,比单纯 World Model 更强调可执行动作。