中文

VideoPhy-2:视频生成中以动作为中心的挑战性物理常识评估

计算机视觉与模式识别 2025-03-11 v1

摘要

能够生成多样化视觉概念逼真视频的大规模视频生成模型,是构建通用物理世界模拟器的有力候选者。然而,它们在真实世界动作(例如打网球、后空翻)中对物理常识的遵循程度仍不明确。现有基准存在诸多局限性,如规模有限、缺乏人类评估、仿真与现实的差距以及缺乏细粒度的物理规则分析。为了解决这些问题,我们引入了 VideoPhy-2,一个用于评估生成视频中物理常识的以动作为中心的数据集。我们从现代生成模型中精选了 200 种不同的动作以及用于视频合成的详细提示词。我们进行了人类评估,以评估生成视频的语义一致性、物理常识以及物理规则的依据。我们的发现揭示了模型存在重大缺陷,即使是最好的模型在 VideoPhy-2 的困难子集上也仅实现了 22% 的联合性能(即高语义和物理常识一致性)。我们发现模型在处理质量和动量等守恒定律时尤为困难。最后,我们还训练了 VideoPhy-AutoEval,这是一个用于在我们的数据集上进行快速、可靠评估的自动评估器。总体而言,VideoPhy-2 作为一个严格的基准,暴露了视频生成模型中的关键缺陷,并为基于物理的视频生成的未来研究提供了指导。数据和代码可在 https://videophy2.github.io/ 获取。

关键词

引用

@article{arxiv.2503.06800,
  title  = {VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation},
  author = {Hritik Bansal and Clark Peng and Yonatan Bitton and Roman Goldenberg and Aditya Grover and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2503.06800},
  year   = {2025}
}

备注

41 pages, 33 Figures