Sora、JEPA、Genie、Marble 的技术路线
比较 Sora、JEPA、Genie、Marble 的变量、目标和接口,围绕 video latent、表征预测、latent action dynamics 与 3D world state。
Sora、JEPA、Genie、Marble 是四条从视觉数据学习世界结构的路线。Sora 在 video latent 上生成 observation,JEPA 预测 representation,Genie 学 latent-action dynamics,Marble 生成 3D world state。
容易混的是两件事。生成 observation,不等于建模 action-conditioned transition。前者问“画面会是什么”。后者问“我做了动作以后,状态怎么变”。
Sora 的 video latent renderer
Sora 的问题是给定条件 \(c\),生成一段视频 \(x_{1\ldots T}\)。它先把视频压到 latent,再切成 spacetime patches,最后用 diffusion Transformer 在 patch 序列上去噪。
OpenAI 公开的技术路线是视频压缩到 latent space,切成 spacetime patches,Transformer 学习从 noisy patches 预测 clean patches。(OpenAI Sora report)

Sora 的能力来自大规模视频生成目标。3D consistency、object permanence、简单交互痕迹,都被压在 latent 和 denoising network 里。OpenAI 也说这些能力不是显式 3D、物体或物理模块带来的,而是规模化训练后的现象。(OpenAI Sora simulation capabilities)
问题也在这里。Sora 没有公开的状态变量 \(z_t\),也没有动作输入 \(a_t\)。它能回答这个问题。
它不能以环境模型的形式回答另一个问题。
所以 Sora 更像 renderer。把它叫 world simulator 可以,但含义必须很窄。它在视频生成中隐式吸收了世界规律。按机器人或 model-based RL 的接口,它缺的是 transition。
JEPA 不画像素,只预测表征
JEPA 的问题是给定可见部分,预测被遮住或未来部分的 representation。它不生成 pixels。它让 predictor 在 embedding space 里对齐 target encoder 的输出。
Meta 对 V-JEPA 的说法很清楚。这是 non-generative model,在 abstract representation space 里预测 video 的 missing 或 masked parts,不预测像素。(Meta V-JEPA)

Sora 追求 observation quality。JEPA 追求 representation predictability。这个差别比“生成式”和“非生成式”更重要。
普通 V-JEPA 不是动作条件世界模型。它没有显式学习 \(p(z_{t+1}\mid z_t,a_t)\)。它学的是“世界在表征空间里哪些部分可预测”。代价是没有自然的可视输出,也没有天然的动作闭环。
V-JEPA 2-AC 才把动作接进去。V-JEPA 2 先用超过 100 万小时互联网视频做 action-free 预训练,再用少于 62 小时 DROID 机器人视频训练 action-conditioned world model,用于 image-goal planning。(V-JEPA 2)
动作版 JEPA 可以写成
这里 \(q_t\) 可以理解为机器人状态或末端执行器信息。JEPA 路线的价值不是“生成一个世界画面”,而是先学一个紧的预测表征,再把 action dynamics 接到这个表征上。
Genie 把动作接到 video tokens 上
Genie 补的是 Sora 缺的动作接口。它不是一次性生成一段视频,而是在每一步接收 action,再生成下一帧 observation。
Genie 的三块结构是 spatiotemporal video tokenizer、latent action model、autoregressive dynamics model。训练数据是无标签互联网视频,没有真实 action labels。因此 latent action model 从相邻帧变化里学离散动作代码。(Genie)

Genie 的强点很明确。它把视频生成改造成 action-conditioned observation prediction。
但 Genie 的 state 仍是 video tokens。它不是显式几何状态,不是刚体状态,不是接触、材料、力的状态。动作也是 learned latent action,不是真实机器人控制量。
因此 Genie 比 Sora 更接近 world model 的接口,但它仍更像 action-conditioned renderer。它解决了“能不能控制下一帧”的问题,没有完全解决“状态能不能被物理和规划系统直接查询”的问题。
Marble 把输入 lift 成 3D world state
Marble 的问题不是下一帧,而是空间。给定文本、图像、视频或粗 3D layout,它生成一个可浏览、可编辑、可导出的 3D world。
World Labs 写明 Marble 可以从 text、image、video、coarse 3D layouts 创建 3D worlds,并支持编辑、扩展、组合、导出。导出格式包括 Gaussian splats、meshes、videos。mesh 里还包括 collider meshes,用于粗物理仿真。(Marble)

Marble 和 Sora 的核心差别是输出对象。Sora 输出 observation。Marble 输出空间对象 \(W\)。这个对象可以被浏览、编辑、扩展,也可以导出到后续 3D 或仿真管线。
但公开资料没有给出动作条件动态。
也没有说明模型本身如何学习连续动作、接触、力和材料变化。Marble 强在 state generation。弱点不是视觉,而是 transition 还没有被公开成核心接口。
四条路线怎么比较
这四条路线的差别,不是“谁更像世界”。差别是各自把世界压成什么变量。
| 路线 | 核心算子 | 强项 | 缺口 |
|---|---|---|---|
| Sora | \(c\rightarrow x_{1\ldots T}\) | 高保真 video renderer | 没有显式 action 和 state |
| JEPA | \((x_A,B)\rightarrow h_B\) | 抽象表征预测 | 普通 V-JEPA 没有动作闭环 |
| Genie | \((z_{\le t},a_t^\ell)\rightarrow z_{t+1}\) | latent action control | state 仍是 video tokens |
| Marble | \(c\rightarrow W\) | 3D world state | 缺公开的 action-conditioned transition |
换句话说,Sora 解决“看起来是什么”。JEPA 解决“表征里可预测的是什么”。Genie 解决“动作之后下一帧是什么”。Marble 解决“空间对象是什么”。
和 world model 的关系
如果 world model 指“模型内部有世界规律”,四条路线都能被放进去。这个定义太宽,区分度不够。
如果 world model 指“可供 agent 查询的环境动态”,核心接口是 transition。
把四条路线投到同一个接口,会更清楚。绿色是强模块。黄色是部分满足。灰色是缺口。
按这个接口看,Sora 不满足。普通 V-JEPA 不满足。Genie 部分满足,因为它有 latent action dynamics。V-JEPA 2-AC 更接近,因为 action 进入了 representation dynamics。Marble 有显式空间状态,但公开资料还没有把 \(T(W_t,a_t)\) 作为核心模型接口。
更准确的判断是,它们不是四个等价的 world model,而是四个可能组合的算子。
完整路线需要这些接口同时存在。可渲染,可预测,可动作控制,可计算空间状态。Sora、JEPA、Genie、Marble 各自只把其中一块做强了。
参考资料
- OpenAI, Video generation models as world simulators, 2024。
- Meta AI, V-JEPA, 2024。
- Assran et al., V-JEPA 2, 2025。
- Bruce et al., Genie, 2024。
- World Labs, Marble, 2025。
- World Labs, A Functional Taxonomy of World Models, 2026。