中文

PISA 实验:通过观察物体下落探索视频扩散模型的物理后训练

计算机视觉与模式识别 2025-03-13 v1

摘要

大规模预训练视频生成模型在内容创作方面表现出色,但开箱即用并不能可靠地作为物理精确的世界模拟器。本工作通过简单而基础的物理任务——建模物体自由落体——的视角,研究了对这些模型进行后训练以实现精确世界建模的过程。我们表明,最先进的视频生成模型尽管输出视觉上令人印象深刻,但在这一基本任务上仍然表现不佳。为了解决这一问题,我们发现,在相对少量的模拟视频上进行微调能够有效诱导模型产生下落行为,并且我们可以通过引入一种新颖的奖励建模程序进一步改善结果。我们的研究还揭示了后训练在泛化和分布建模方面的关键局限性。此外,我们发布了一个该任务的基准测试,可作为跟踪大规模视频生成模型物理准确性的有用诊断工具。

关键词

引用

@article{arxiv.2503.09595,
  title  = {PISA Experiments: Exploring Physics Post-Training for Video Diffusion Models by Watching Stuff Drop},
  author = {Chenyu Li and Oscar Michel and Xichen Pan and Sainan Liu and Mike Roberts and Saining Xie},
  journal= {arXiv preprint arXiv:2503.09595},
  year   = {2025}
}