T2VPhysBench:面向文本到视频生成物理一致性的第一性原理基准
机器学习
2025-05-02 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
近年来,文本到视频生成模型取得了长足进步,能够生成在美学吸引力和指令遵循准确性方面均表现出色的高质量视频,并已成为数字艺术创作和在线用户参与的核心。然而,尽管取得了这些进展,它们遵循基本物理定律的能力在很大程度上仍未得到检验:许多输出仍然违反基本约束,如刚体碰撞、能量守恒和引力动力学,导致内容不真实甚至具有误导性。现有的物理评估基准通常依赖于对简单生活场景提示应用的自动化像素级指标,因此忽略了人类判断和第一性原理物理。为填补这一空白,我们引入了T2VPhysBench,这是一个基于第一性原理的基准,旨在系统评估当前最先进的文本到视频系统(包括开源和商业系统)是否遵循十二项核心物理定律,包括牛顿力学、守恒原理和唯象效应。我们的基准采用严格的人工评估协议,并包含三项针对性研究:(1)总体合规性评估,显示所有模型在每个定律类别中的平均得分均低于0.60;(2)提示消融研究,揭示即使是详细的、针对特定定律的提示也无法纠正物理违规;(3)反事实鲁棒性测试,证明模型在收到明确指令时,通常会生成显式违反物理规则的视频。这些结果揭示了当前架构中持续存在的局限性,并为指导未来研究走向真正具有物理感知的视频生成提供了具体见解。
引用
@article{arxiv.2505.00337,
title = {T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation},
author = {Xuyang Guo and Jiayan Huo and Zhenmei Shi and Zhao Song and Jiahao Zhang and Jiale Zhao},
journal= {arXiv preprint arXiv:2505.00337},
year = {2025}
}