中文

VideoPhy:评估视频生成的物理常识

计算机视觉与模式识别 2024-10-04 v2 人工智能 机器学习

摘要

近期互联网规模视频数据预训练的进展催生了文本到视频生成模型的发展,这些模型能够创建涵盖广泛视觉概念的高质量视频,合成逼真的运动并渲染复杂物体。因此,这些生成模型有潜力成为物理世界的通用模拟器。然而,目前尚不清楚现有文本到视频生成模型距离这一目标还有多远。为此,我们提出了VideoPhy,这是一个旨在评估生成视频是否遵循现实世界活动物理常识(例如,弹珠放在倾斜表面上时会滚下)的基准。具体来说,我们整理了涉及物理世界中各种材料类型(如固体-固体、固体-流体、流体-流体)之间相互作用的多样化提示。然后,我们基于这些描述,使用多种最先进的文本到视频生成模型(包括开放模型如CogVideoX和封闭模型如Lumiere、Dream Machine)生成视频。我们的人工评估显示,现有模型严重缺乏生成遵循给定文本提示的视频的能力,同时也缺乏物理常识。具体而言,表现最好的模型CogVideoX-5B在39.6%的实例中生成了符合描述和物理定律的视频。因此,VideoPhy凸显了视频生成模型远未达到准确模拟物理世界的水平。最后,我们提出了一个自动评估器VideoCon-Physics,以可靠地评估新发布模型的性能。

关键词

引用

@article{arxiv.2406.03520,
  title  = {VideoPhy: Evaluating Physical Commonsense for Video Generation},
  author = {Hritik Bansal and Zongyu Lin and Tianyi Xie and Zeshun Zong and Michal Yarom and Yonatan Bitton and Chenfanfu Jiang and Yizhou Sun and Kai-Wei Chang and Aditya Grover},
  journal= {arXiv preprint arXiv:2406.03520},
  year   = {2024}
}

备注

43 pages, 29 figures, 12 tables. Added CogVideo and Dream Machine in v2