VBench-2.0:面向内在忠实性的视频生成基准套件升级
计算机视觉与模式识别
2025-08-21 v2
摘要
视频生成技术取得了显著进展,从生成不真实的输出,逐步发展到生成视觉上令人信服且在时间上连贯的视频。为了评估这些视频生成模型,已开发出诸如 VBench 等基准测试,以衡量其忠实性,包括单帧美学、时间一致性和基本提示遵循等因素。然而,这些方面主要代表的是表层忠实性,侧重于视频是否视觉上令人信服,而非是否遵循现实世界原理。尽管最近的模型在这些指标上表现日益出色,但仍难以生成不仅视觉上合理而且根本上真实的视频。要实现通过视频生成获得真正的“世界模型”,下一 frontier 必须在于内在忠实性,以确保生成的视频遵循物理定律、常识推理、解剖正确性以及组成完整性。实现这一水平的现实感对于 AI 辅助电影制作和模拟世界建模等应用至关重要。为弥合这一差距,我们引入 VBench-2.0,一个用于自动评估视频生成模型内在忠实性的下一代基准测试。VBench-2.0 评估五个关键维度:人类忠实性、可控性、创造性、物理性和常识性,每个维度进一步细分为细粒度能力。针对各个维度,我们的评估框架整合了通用专家,如最先进的视觉语言模型和大语言模型,以及专家工具,包括用于视频生成的异常检测方法。我们进行大量的人类标注,以确保评估与人类判断一致。通过超越表层忠实性,朝向内在忠实性,VBench-2.0 旨在为下一代视频生成模型树立新标准,以追求内在忠实性。
关键词
引用
@article{arxiv.2503.21755,
title = {VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness},
author = {Dian Zheng and Ziqi Huang and Hongbo Liu and Kai Zou and Yinan He and Fan Zhang and Lulu Gu and Yuanhan Zhang and Jingwen He and Wei-Shi Zheng and Yu Qiao and Ziwei Liu},
journal= {arXiv preprint arXiv:2503.21755},
year = {2025}
}
备注
Equal contributions from first two authors. Project page: https://vchitect.github.io/VBench-2.0-project/ Code: https://github.com/Vchitect/VBench