DreamZero#

DreamZero 是什么#

DreamZero 来自论文《World Action Models are Zero-shot Policies》,是一个建立在预训练视频扩散 backbone 上的 World Action Model。

它的目标很明确:

让模型通过联合预测未来世界状态和动作,学会无需大量重复示教也能泛化到新任务的机器人策略。

../../../../../_images/joint_wam_overview.svg

为什么提出 DreamZero#

VLA 模型在语义泛化上很强,例如能理解“拿起红色杯子”“把碗放到盘子旁边”。但它们经常缺少对真实物理运动的泛化:

  • 新物体形状。

  • 新场景布局。

  • 新机械臂姿态。

  • 新的接触和运动模式。

DreamZero 的出发点是:视频里包含了比静态图像丰富得多的物理动态。如果模型学会了世界如何随动作变化,就可以更好地适应未见过的物理场景。

核心技术讲解#

预训练视频扩散 backbone#

DreamZero 建立在视频扩散模型之上。视频扩散模型本来擅长生成未来视频,因此天然携带时空动态先验。

DreamZero 把这个先验转化成机器人控制能力:模型不只是生成视频,还要联合输出动作。

联合建模视频和动作#

DreamZero 的关键不是:

先预测未来视频 -> 再手写规则求动作

而是直接学习:

当前观测 + 指令 -> 未来世界状态 + 动作

这样动作和未来状态在同一个模型中互相约束。动作应该导致合理未来,未来预测也应该和可执行动作一致。

Zero-shot Policy#

论文标题里的 zero-shot policy 指的是,WAM 学到的动态和动作先验可以直接支持未见过任务的泛化,而不是每个任务都靠大量重复示教。

这里的“zero-shot”不是说完全不需要机器人数据,而是强调模型可以通过世界动作建模获得更强的新任务、新环境泛化能力。

实时闭环控制#

WAM 的一个现实问题是扩散模型通常慢。DreamZero 通过模型和系统优化,让大型 autoregressive video diffusion model 能够做实时闭环控制。

这点很关键:机器人不能等几十秒再动一次。世界模型要真正上机器人,必须接近实时。

和具身智能的关系#

DreamZero 的意义在于把“想象未来”和“执行动作”统一起来。它适合处理:

  • 未见过的物体组合。

  • 新场景下的操作任务。

  • 跨机器人或人类视频迁移。

  • 少量新 embodiment 数据适配。

它代表了一种趋势:机器人策略不只是模仿动作,而是通过世界模型理解动作后果。

局限#

  • 大型视频扩散 backbone 部署成本高。

  • 未来预测错误会影响动作。

  • 实时闭环需要大量工程优化。

  • 长时序复杂任务仍可能累积误差。

小结#

DreamZero 的核心思想是:把预训练视频扩散模型改造成 World Action Model,通过联合建模未来世界状态和动作来获得更强的零样本/少样本泛化。

参考#