DreamDojo
========================================

DreamDojo 是什么
----------------------------------------

DreamDojo 来自论文《DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos》，是面向机器人操控任务的通用世界模型/视频生成框架。它的名字可以理解为“让机器人在梦里练习的训练场”。

它关注的问题是：

**能不能通过生成式 world model，为机器人提供可控、可扩展的想象环境，从而帮助学习操控技能？**

在机器人任务里，真实数据很贵，仿真又容易和真实世界有差距。DreamDojo 使用大规模第一视角人类视频进行预训练，再通过机器人数据进行后训练，希望让机器人能在模型想象出的未来中学习。

.. image:: pic/robot_world_model_loop.svg
   :width: 88%
   :align: center

为什么提出 DreamDojo
----------------------------------------

机器人操控任务需要大量多样数据：

- 不同物体。
- 不同桌面。
- 不同光照。
- 不同动作轨迹。
- 成功和失败案例。

但真实采集成本非常高。另一方面，传统物理仿真虽然可控，但视觉真实感和真实物体交互常常不足。

DreamDojo 的动机是把生成式模型引入机器人学习：让模型学习真实交互视频中的规律，再用它生成或预测可能的未来，作为机器人学习的“练习场”。

核心技术讲解
----------------------------------------

从视频学习交互动态
~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~

机器人操控视频中包含非常重要的信息：

- 手/夹爪如何接近物体。
- 接触发生后物体如何移动。
- 成功抓取和失败抓取有什么区别。
- 不同动作会导致什么视觉后果。

DreamDojo 这类方法会从视频中学习这些动态规律，让模型具备“看动作推未来”的能力。

Latent Action：没有动作标签时怎么办
~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~

真实机器人数据里可以记录关节动作，但大规模人类视频通常没有机器人动作标签。DreamDojo 的关键思路之一是使用 **latent action** 作为代理动作。

可以把 latent action 理解为模型自己从视频变化中抽象出来的“隐含动作”：

.. code-block:: text

   前一段视频 + 后一段视频 -> 中间发生了某种动作

模型不一定知道这个动作对应具体关节角，但可以学到它导致了怎样的视觉变化。之后再用少量机器人数据把这些隐含动作和机器人控制联系起来。

生成式想象
~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~

如果模型能生成未来交互过程，就可以用于数据增强或规划。

例如输入：

.. code-block:: text

   当前桌面图像 + 机械臂动作 + 任务条件

输出：

.. code-block:: text

   未来几帧交互结果

机器人可以利用这些想象结果判断某个动作是否可能成功。

Dojo：作为训练场
~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~

“Dojo”这个名字强调训练场。它不是只做一次视频预测，而是希望提供一个可用于策略学习的环境。

理想情况下，机器人可以在 world model 中反复试动作：

- 成本低。
- 速度快。
- 可以覆盖更多场景。
- 避免真实硬件过度试错。

然后再把学到的策略迁移到真实世界。

和 PlaNet 的关系
----------------------------------------

PlaNet 在 latent dynamics 中规划，重点是 model-based RL。DreamDojo 更接近现代生成式视频 world model，强调视觉真实感、操控视频和可扩展数据。

可以粗略比较：

.. list-table::
   :header-rows: 1
   :widths: 22 38 40

   * - 方法
     - 核心关注
     - 直觉
   * - PlaNet
     - latent dynamics + planning
     - 在低维潜在空间想象未来
   * - DreamDojo
     - 机器人交互视频生成/预测
     - 在视觉世界里给机器人提供练习场

和具身智能的关系
----------------------------------------

DreamDojo 的目标和具身智能非常贴近，因为它直接面向机器人学习：

- 用 world model 学习动作后果。
- 用想象数据提高策略学习效率。
- 支持不同任务和物体的泛化。
- 连接视频生成和机器人控制。

对于 VLA 模型来说，这类 world model 可以作为“预测器”或“critic”辅助判断动作是否合理。

局限
----------------------------------------

- 生成视频的物理正确性仍是难点。
- 模型想象和真实世界之间可能有偏差。
- 长时序任务容易累积错误。
- 如果没有好的动作表示，模型很难真正可控。

小结
----------------------------------------

DreamDojo 的核心思想是：**把生成式 world model 变成机器人操控的想象训练场，让机器人在低成本预测/生成环境中学习动作后果。**

它体现了从“视频生成”走向“机器人可用 world model”的趋势。

参考
----------------------------------------

- Gao et al., `DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos <https://arxiv.org/abs/2602.06949>`_, 2026.
- `DreamDojo project page <https://dreamdojo-world.github.io/>`_.
- `NVIDIA DreamDojo GitHub <https://github.com/NVIDIA/DreamDojo>`_.
