DreamZero#
DreamZero 是什么#
DreamZero 来自论文《World Action Models are Zero-shot Policies》,是一个建立在预训练视频扩散 backbone 上的 World Action Model。
它的目标很明确:
让模型通过联合预测未来世界状态和动作,学会无需大量重复示教也能泛化到新任务的机器人策略。
为什么提出 DreamZero#
VLA 模型在语义泛化上很强,例如能理解“拿起红色杯子”“把碗放到盘子旁边”。但它们经常缺少对真实物理运动的泛化:
新物体形状。
新场景布局。
新机械臂姿态。
新的接触和运动模式。
DreamZero 的出发点是:视频里包含了比静态图像丰富得多的物理动态。如果模型学会了世界如何随动作变化,就可以更好地适应未见过的物理场景。
核心技术讲解#
预训练视频扩散 backbone#
DreamZero 建立在视频扩散模型之上。视频扩散模型本来擅长生成未来视频,因此天然携带时空动态先验。
DreamZero 把这个先验转化成机器人控制能力:模型不只是生成视频,还要联合输出动作。
联合建模视频和动作#
DreamZero 的关键不是:
先预测未来视频 -> 再手写规则求动作
而是直接学习:
当前观测 + 指令 -> 未来世界状态 + 动作
这样动作和未来状态在同一个模型中互相约束。动作应该导致合理未来,未来预测也应该和可执行动作一致。
Zero-shot Policy#
论文标题里的 zero-shot policy 指的是,WAM 学到的动态和动作先验可以直接支持未见过任务的泛化,而不是每个任务都靠大量重复示教。
这里的“zero-shot”不是说完全不需要机器人数据,而是强调模型可以通过世界动作建模获得更强的新任务、新环境泛化能力。
实时闭环控制#
WAM 的一个现实问题是扩散模型通常慢。DreamZero 通过模型和系统优化,让大型 autoregressive video diffusion model 能够做实时闭环控制。
这点很关键:机器人不能等几十秒再动一次。世界模型要真正上机器人,必须接近实时。
和具身智能的关系#
DreamZero 的意义在于把“想象未来”和“执行动作”统一起来。它适合处理:
未见过的物体组合。
新场景下的操作任务。
跨机器人或人类视频迁移。
少量新 embodiment 数据适配。
它代表了一种趋势:机器人策略不只是模仿动作,而是通过世界模型理解动作后果。
局限#
大型视频扩散 backbone 部署成本高。
未来预测错误会影响动作。
实时闭环需要大量工程优化。
长时序复杂任务仍可能累积误差。
小结#
DreamZero 的核心思想是:把预训练视频扩散模型改造成 World Action Model,通过联合建模未来世界状态和动作来获得更强的零样本/少样本泛化。
参考#
Ye et al., World Action Models are Zero-shot Policies, 2026.