扩散式 Joint WAM 概览#

扩散式怎么理解#

扩散式模型的直觉是:从噪声开始,反复去噪,最后生成一个合理结果

它不像自回归模型那样从左到右一个个 token 生成,而是更像先有一张模糊草稿,然后不断修改:

随机噪声
   ↓
初步形状
   ↓
更清晰的动作/视频结构
   ↓
最终动作轨迹或未来状态

在图像生成里,扩散模型可以从噪声生成图片。在机器人和 WAM 里,它可以生成:

  • 一段连续动作轨迹。

  • 一段未来视频或未来 latent。

  • 动作、未来状态、价值信号的联合表示。

为什么适合 WAM#

机器人任务经常不是只有一个正确答案。

例如“拿起杯子”:

  • 可以从左边抓。

  • 可以从右边抓。

  • 可以先绕开障碍物再抓。

  • 可以用不同速度和姿态接近。

扩散模型擅长表达这种 多模态分布。也就是说,它可以表示“多个都合理的答案”,而不是被迫平均成一个怪异动作。

扩散式 WAM 的典型思路是:

当前观测 + 指令 + 噪声
         ↓
多步去噪
         ↓
动作轨迹 + 未来视觉/状态

优点和局限#

优点:

  • 适合连续动作控制。

  • 能表达多种可行轨迹。

  • 容易和视频生成、latent diffusion、trajectory diffusion 结合。

  • 生成的是一整段轨迹,整体一致性通常比较好。

局限:

  • 推理往往需要多步去噪,速度可能较慢。

  • 去噪过程如果没有约束,可能生成看起来合理但执行不稳的动作。

  • 对实时机器人控制,需要蒸馏、少步采样或闭环修正。

小结#

扩散式 Joint WAM 更像是 整体生成一段合理的行动和未来

它适合连续动作、多解任务和视频/轨迹联合生成,但需要处理采样速度和执行稳定性问题。