自回归 Joint WAM 概览
========================================

自回归怎么理解
----------------------------------------

自回归的英文是 **Autoregressive**。最直观的理解是：**每一步都根据前面已经生成的内容，继续生成下一步**。

语言模型就是典型自回归模型。它写一句话时不是一次性把整句话全部吐出来，而是一个 token 一个 token 地生成：

.. code-block:: text

   今天 -> 今天 天气 -> 今天 天气 很 -> 今天 天气 很 好

放到 WAM 里，如果把视觉、语言、动作都表示成 token，就可以用类似方式生成：

.. code-block:: text

   当前观测
      ↓
   第一个动作 token
      ↓
   下一个视觉/状态 token
      ↓
   下一个动作 token
      ↓
   ...

为什么适合 WAM
----------------------------------------

机器人任务天然有时间顺序：

.. code-block:: text

   先靠近杯子 -> 张开夹爪 -> 对准杯子 -> 闭合夹爪 -> 抬起

自回归模型很适合表达这种“前一步影响后一步”的结构。它也容易复用大语言模型的能力，因为 LLM 本来就是自回归生成器。

在 Joint WAM 中，自回归路线可以把动作和未来状态组织成一个序列：

.. code-block:: text

   观测 token, 指令 token, 动作 token, 未来视觉 token, 动作 token ...

模型要学的就是：给定前面的上下文，下一个最合理的 token 是什么。

优点和局限
----------------------------------------

优点：

- 很适合序列建模，容易表示步骤和因果顺序。
- 可以自然接入语言模型、多模态 token 和长上下文。
- 对离散动作、动作 token、视觉 token 的统一建模比较方便。

局限：

- 一步步生成，长轨迹推理速度可能较慢。
- 前面生成错了，后面容易被带偏，出现误差累积。
- 连续动作需要先离散化或设计专门的动作表示。
- 对多种可行动作的表达，有时不如扩散模型自然。

和扩散式的区别
----------------------------------------

一句话对比：

.. code-block:: text

   自回归：按顺序写出来
   扩散式：从噪声整体修出来

如果任务更强调步骤、语义顺序、token 统一表示，自回归路线很自然；如果任务更强调连续轨迹、多解动作和整体生成，扩散式路线通常更顺手。

小结
----------------------------------------

自回归 Joint WAM 更像是 **按顺序写出一段行动和未来**。

它适合 token 化、多模态序列和长上下文推理，但需要处理生成速度和误差累积问题。
