比较 Sora、JEPA、Genie、Marble 的变量、目标和接口,围绕 video latent、表征预测、latent action dynamics 与 3D world state。
Tag
4 posts in this topic.
Blog比较 Sora、JEPA、Genie、Marble 的变量、目标和接口,围绕 video latent、表征预测、latent action dynamics 与 3D world state。
从学习目标区分 VLA、世界模型与 WAM:VLA 直接生成动作,世界模型预测动作后果,WAM 将动作和未来状态联合建模。
以动作闭环为主线,梳理世界模型从 model-based RL、latent dynamics 到交互式视频模型和机器人行动接口的发展脉络。
从 Ha 与 Schmidhuber 的 V-M-C 架构,到 Genie、V-JEPA、PAN 和 NVIDIA 的物理 AI 视角,梳理世界模型的定义、公式、路线和边界。