面向视频生成的物理常识基准:构建世界模拟器
计算机视觉与模式识别
2024-10-10 v1
摘要
文本到视频(T2V)模型如 Sora 在可视化复杂提示方面取得了显著进展,人们越来越认为这是通往通用世界模拟器的有力路径。认知心理学家认为,实现这一目标的基础是理解直观物理的能力。然而,这些模型准确表示直观物理的能力仍大体未被探索。为弥合这一差距,我们引入了 PhyGenBench,即一个全面的 \textbf{Phy}sics \textbf{Gen}eration \textbf{Ben}chmark,旨在评估 T2V 生成中物理常识的正确性。PhyGenBench 包含 160 个精心设计的提示,涵盖 27 种不同的物理法则,跨越四个基本领域,能够全面评估模型对物理常识的理解。除了 PhyGenBench,我们提出了一种新型评估框架称为 PhyGenEval。该框架采用层次化评估结构,运用合适的先进视觉-语言模型和大语言模型来评估物理常识。通过 PhyGenBench 和 PhyGenEval,我们可以对 T2V 模型的物理常识理解进行大规模自动评估,这些评估与人类反馈高度一致。我们的评估结果和深入分析表明,当前模型在生成符合物理常识的视频方面存在挑战。仅靠扩大模型规模或采用提示工程技术不足以完全应对 PhyGenBench 所呈现的挑战(例如动态情景)。我们希望本研究能激励社区在这些模型中优先学习物理常识,超越娱乐应用。我们将在 https://github.com/OpenGVLab/PhyGenBench 上发布数据和代码。
关键词
引用
@article{arxiv.2410.05363,
title = {Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation},
author = {Fanqing Meng and Jiaqi Liao and Xinyu Tan and Wenqi Shao and Quanfeng Lu and Kaipeng Zhang and Yu Cheng and Dianqi Li and Yu Qiao and Ping Luo},
journal= {arXiv preprint arXiv:2410.05363},
year = {2024}
}
备注
Project Page: https://phygenbench123.github.io/