Joint WAM 概览
========================================

Joint WAM 是什么
----------------------------------------

Joint WAM 强调把 **动作** 和 **未来世界状态** 放在一起建模。

在前面的 WAM 概览里，我们把 WAM 理解成：

.. code-block:: text

   当前观测 + 指令 + 动作 <-> 未来世界变化

Joint WAM 更进一步，希望用一个统一模型同时生成或预测动作与未来状态，而不是先用一个 world model 生成未来，再用另一个模型把未来转成动作。

为什么会有 Joint WAM
----------------------------------------

Cascaded WAM 的结构比较清晰：

.. code-block:: text

   先预测未来视觉目标
          ↓
   再生成机器人动作

但这种级联结构有一个天然问题：前一级预测错了，后一级很容易跟着错。

Joint WAM 想减少这种断裂，把动作和未来状态放在同一个建模空间中，让模型直接学习：

- 什么动作会导致什么未来。
- 什么未来需要什么动作实现。
- 动作、状态、价值或成功概率之间如何对应。

两种常见生成方式
----------------------------------------

Joint WAM 里经常会看到两个词：

- **自回归（Autoregressive）**
- **扩散式（Diffusion-based）**

它们的区别不在于“是不是 WAM”，而在于模型如何生成结果。

自回归方法像语言模型写句子：先生成第一个 token，再根据前面的 token 生成下一个 token。

.. code-block:: text

   当前观测 -> token 1 -> token 2 -> token 3 -> ...

如果把视频、动作、语言都表示成 token，那么自回归模型就可以统一地“续写”未来和动作。

扩散式方法像从草稿逐步修成清晰图片：先从随机噪声开始，然后一步步去噪，最后得到一段动作轨迹、未来视频，或两者的联合表示。

.. code-block:: text

   随机噪声 -> 粗略轨迹 -> 更合理轨迹 -> 最终动作/未来

简单说：

- 自回归适合表达顺序推理和 token 序列。
- 扩散式适合生成连续轨迹、多种可能动作和未来视频。

小结
----------------------------------------

Joint WAM 的一句话理解是：**把机器人动作和世界变化放到同一个模型里联合生成、联合预测。**

它比单纯 VLA 更强调动作后果，比单纯 World Model 更强调可执行动作。
