扩散式 Joint WAM 概览#
扩散式怎么理解#
扩散式模型的直觉是:从噪声开始,反复去噪,最后生成一个合理结果。
它不像自回归模型那样从左到右一个个 token 生成,而是更像先有一张模糊草稿,然后不断修改:
随机噪声
↓
初步形状
↓
更清晰的动作/视频结构
↓
最终动作轨迹或未来状态
在图像生成里,扩散模型可以从噪声生成图片。在机器人和 WAM 里,它可以生成:
一段连续动作轨迹。
一段未来视频或未来 latent。
动作、未来状态、价值信号的联合表示。
为什么适合 WAM#
机器人任务经常不是只有一个正确答案。
例如“拿起杯子”:
可以从左边抓。
可以从右边抓。
可以先绕开障碍物再抓。
可以用不同速度和姿态接近。
扩散模型擅长表达这种 多模态分布。也就是说,它可以表示“多个都合理的答案”,而不是被迫平均成一个怪异动作。
扩散式 WAM 的典型思路是:
当前观测 + 指令 + 噪声
↓
多步去噪
↓
动作轨迹 + 未来视觉/状态
优点和局限#
优点:
适合连续动作控制。
能表达多种可行轨迹。
容易和视频生成、latent diffusion、trajectory diffusion 结合。
生成的是一整段轨迹,整体一致性通常比较好。
局限:
推理往往需要多步去噪,速度可能较慢。
去噪过程如果没有约束,可能生成看起来合理但执行不稳的动作。
对实时机器人控制,需要蒸馏、少步采样或闭环修正。
小结#
扩散式 Joint WAM 更像是 整体生成一段合理的行动和未来。
它适合连续动作、多解任务和视频/轨迹联合生成,但需要处理采样速度和执行稳定性问题。