“PhyWorldBench”:文本到视频模型物理真实性的综合评估
计算机视觉与模式识别
2026-05-27 v3 人工智能
摘要
视频生成模型在创建高质量、逼真内容方面取得了显著进展。然而,它们准确模拟物理现象的能力仍然是一个关键且未解决的挑战。本文提出了PhyWorldBench,一个旨在根据视频生成模型遵循物理定律的程度对其进行评估的综合基准。该基准涵盖了多个层次的物理现象,从物体运动和能量守恒等基本原理,到涉及刚体相互作用以及人类或动物运动的更复杂场景。此外,我们引入了一个新颖的“反物理”类别,其中的提示故意违反现实世界的物理规律,从而能够评估模型在保持逻辑一致性的同时是否能够遵循此类指令。除了大规模人工评估外,我们还设计了一种简单而有效的方法,利用当前的多模态大语言模型以零样本方式评估物理真实性。我们评估了12个最先进的文本到视频生成模型,包括5个开源模型和5个专有模型,并进行了详细的比较和分析。通过在涵盖基础、复合和反物理场景的1050个精心策划的提示上进行系统测试,我们识别出这些模型在遵循现实世界物理规律方面面临的关键挑战。我们进一步考察了它们在不同物理现象和提示类型下的表现,并得出了针对性的建议,以设计能够增强对物理原理遵循度的提示。
引用
@article{arxiv.2507.13428,
title = {"PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models},
author = {Jing Gu and Xian Liu and Yu Zeng and Ashwin Nagarajan and Fangrui Zhu and Daniel Hong and Yue Fan and Qianqi Yan and Kaiwen Zhou and Ming-Yu Liu and Xin Eric Wang},
journal= {arXiv preprint arXiv:2507.13428},
year = {2026}
}
备注
35 pages, 21 figures