你的数据集能将鸡蛋挑开吗?物理常识基准测试视频生成模型
计算机视觉与模式识别
2025-07-22 v1
摘要
最近的文本到视频(T2V)生成进展使能够合成从自然语言生成的视觉引人注目且时间上连贯的视频。然而,这些模型在基本物理常识方面常常不堪,产生的输出违反了关于因果、对象行为和工具使用的直观期望。在此基础上,我们提出了 PhysVidBench,旨在评估 T2V 系统的物理推理能力。该基准包括 383 个精心挑选的提示,强调工具使用、材料属性和程序交互,以及物理合理性至关重要的领域。对于每个提示,我们使用多种最先进的模型生成视频,并采用三个阶段的评估管道:(1) 从提示中构建具体的物理问题,(2) 用视觉语言模型为生成的视频生成说明,(3) 要求语言模型仅使用说明回答若干物理问题。这一间接策略规避了直接视频基于评估中常见的幻觉问题。通过突出工具中介动作和可供 affordances,当前 T2V 评估中所忽视的领域,PhysVidBench 为评估生成式视频模型的物理常识提供了结构化、可解释的框架。
引用
@article{arxiv.2507.15824,
title = {Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models},
author = {Enes Sanli and Baris Sarper Tezcan and Aykut Erdem and Erkut Erdem},
journal= {arXiv preprint arXiv:2507.15824},
year = {2025}
}