扩散式 Joint WAM 概览
========================================

扩散式怎么理解
----------------------------------------

扩散式模型的直觉是：**从噪声开始，反复去噪，最后生成一个合理结果**。

它不像自回归模型那样从左到右一个个 token 生成，而是更像先有一张模糊草稿，然后不断修改：

.. code-block:: text

   随机噪声
      ↓
   初步形状
      ↓
   更清晰的动作/视频结构
      ↓
   最终动作轨迹或未来状态

在图像生成里，扩散模型可以从噪声生成图片。在机器人和 WAM 里，它可以生成：

- 一段连续动作轨迹。
- 一段未来视频或未来 latent。
- 动作、未来状态、价值信号的联合表示。

为什么适合 WAM
----------------------------------------

机器人任务经常不是只有一个正确答案。

例如“拿起杯子”：

- 可以从左边抓。
- 可以从右边抓。
- 可以先绕开障碍物再抓。
- 可以用不同速度和姿态接近。

扩散模型擅长表达这种 **多模态分布**。也就是说，它可以表示“多个都合理的答案”，而不是被迫平均成一个怪异动作。

扩散式 WAM 的典型思路是：

.. code-block:: text

   当前观测 + 指令 + 噪声
            ↓
   多步去噪
            ↓
   动作轨迹 + 未来视觉/状态

优点和局限
----------------------------------------

优点：

- 适合连续动作控制。
- 能表达多种可行轨迹。
- 容易和视频生成、latent diffusion、trajectory diffusion 结合。
- 生成的是一整段轨迹，整体一致性通常比较好。

局限：

- 推理往往需要多步去噪，速度可能较慢。
- 去噪过程如果没有约束，可能生成看起来合理但执行不稳的动作。
- 对实时机器人控制，需要蒸馏、少步采样或闭环修正。

小结
----------------------------------------

扩散式 Joint WAM 更像是 **整体生成一段合理的行动和未来**。

它适合连续动作、多解任务和视频/轨迹联合生成，但需要处理采样速度和执行稳定性问题。
