Sora
========================================

Sora 是什么
----------------------------------------

Sora 是 OpenAI 发布的视频生成模型，可以根据文本、图片或视频条件生成高质量视频。OpenAI 在技术报告《Video generation models as world simulators》中把它描述为迈向“世界模拟器”的一步。

从基础 World Model 的角度看，Sora 的意义不只是“生成视频很好看”，而是：

**当一个模型能生成时间连续、物体一致、动作合理的视频时，它可能已经学到了一部分世界动态规律。**

.. image:: pic/video_world_model.svg
   :width: 88%
   :align: center

为什么提出 Sora
----------------------------------------

图像生成模型可以生成一张图，但现实世界是随时间变化的。视频生成要困难得多，因为模型不仅要知道每一帧长什么样，还要保持：

- 物体在多帧之间一致。
- 动作和物理过程连续。
- 镜头移动时空间关系合理。
- 人物、场景、风格不随意漂移。

OpenAI 提出 Sora 的一个核心目标，是把视频生成模型扩展到更大规模，让模型从大量视频数据中学习世界的时空规律。

核心技术讲解
----------------------------------------

视觉 patch：把视频变成 token-like 表示
~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~

Sora 的技术报告中提到，它把视频和图像压缩成 patch 表示。这个思路和 LLM 处理文本 token、ViT 处理图像 patch 有相似直觉：

.. code-block:: text

   文本 -> token 序列
   图像 -> patch 序列
   视频 -> 时空 patch 序列

这样模型可以在统一结构里处理不同长度、不同分辨率和不同时长的视频/图像数据。

Diffusion Transformer
~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~

Sora 属于 diffusion model 路线，并结合 Transformer 架构。

扩散模型的训练直觉是：

1. 给真实视频逐步加噪声。
2. 训练模型学会从噪声中还原干净视频。
3. 生成时从噪声开始，一步步去噪得到视频。

Transformer 则负责建模时空 patch 之间的关系，例如人物、背景、运动轨迹、镜头变化之间的依赖。

文本条件与重描述
~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~

为了让文本更好地控制视频生成，Sora 使用类似 DALL·E 3 的 captioning / recaptioning 思路，为训练视频生成更详细的文本描述。

这很重要，因为网络视频原始标题可能很短或不准确。更详细的文本条件能帮助模型学习：

- 哪些视觉内容对应哪些语言描述。
- 动作、风格、镜头语言如何用文字表达。
- 用户 prompt 如何映射到视频生成结果。

为什么它被看作 World Simulator
----------------------------------------

如果模型能生成一个人在房间里走动、物体保持一致、视角变化合理的视频，它需要某种程度上理解：

- 物体持久性。
- 空间结构。
- 运动连续性。
- 交互关系。

当然，这并不等于模型真正掌握了精确物理。Sora 仍可能出现物理错误、物体变形、因果关系不稳定等问题。但它展示了大规模视频生成模型具备学习世界动态先验的潜力。

和具身智能的关系
----------------------------------------

具身智能需要预测未来。机器人执行动作前，如果能想象接下来会发生什么，就能更好地规划。

Sora 这类视频 world model 对具身智能的启发包括：

- 从大规模视频中学习常识动态。
- 用语言控制未来场景生成。
- 作为高层视觉想象模块，辅助任务规划。
- 为仿真和数据生成提供可能。

但它还不是机器人控制模型。机器人需要动作条件、几何约束、真实坐标系、接触物理和闭环控制，这些不是普通文本到视频模型天然具备的。

局限
----------------------------------------

- 生成视频不等于可执行仿真。
- 物理一致性和长期因果关系仍可能出错。
- 没有天然对接机器人动作空间。
- 生成结果难以直接用于精确控制。

小结
----------------------------------------

Sora 的核心意义是：**通过大规模视频生成，让模型学习时空连续的视觉世界规律，并展示视频模型作为世界模拟器的潜力。**

对机器人来说，它更像高层“视觉想象”和世界先验来源，而不是完整控制器。

参考
----------------------------------------

- OpenAI, `Video generation models as world simulators <https://openai.com/research/video-generation-models-as-world-simulators/>`_, 2024.
