视频生成距离世界模型有多远:从物理定律的视角
计算机视觉与模式识别
2025-06-24 v2 人工智能
摘要
OpenAI的Sora凸显了视频生成开发世界模型的潜力,这些模型遵循基本物理定律。然而,视频生成模型能否仅从视觉数据发现这些定律而无需人类先验条件则值得质疑。一个学习真实规律的世界模型应能对细微差异具有鲁棒性,并且能在未见情景中正确外推。本文在三个关键场景下进行评估:分布内、分布外和组合泛化。我们开发了一个2D模拟测试环境,用于物体运动和碰撞,视频由一个或多个经典力学定律确定性地生成。这提供了大规模实验的无限数据,并使我们能够定量评估生成的视频是否遵循物理定律。我们训练了基于扩散的视频生成模型,以给定初始帧预测物体运动。我们的规模实验显示,在分布内实现完美泛化,对组合泛化表现出可测量的规模行为,但在分布外场景中失败。进一步实验揭示了这些模型泛化机制的两个关键见解:(1)模型未能抽象出通用物理规则,相互表现出“基于案例”的泛化行为,即模仿最近的训练示例;(2)在泛化到新情景时,模型观察到在引用训练数据时优先考虑不同因素:颜色 > 大小 > 速度 > 形状。我们的研究表明,尽管规模在Sora的更广泛成功中发挥作用,但规模本身对于视频生成模型发现基本物理定律仍不够。
引用
@article{arxiv.2411.02385,
title = {How Far is Video Generation from World Model: A Physical Law Perspective},
author = {Bingyi Kang and Yang Yue and Rui Lu and Zhijie Lin and Yang Zhao and Kaixin Wang and Gao Huang and Jiashi Feng},
journal= {arXiv preprint arXiv:2411.02385},
year = {2025}
}
备注
ICML 2025