中文

不可能视频

计算机视觉与模式识别 2025-03-19 v1

摘要

如今,合成视频被广泛用于弥补真实世界视频的数据稀缺与多样性不足。现有的合成数据集主要复现真实世界场景,而对不可能、反事实以及反现实的视频概念探索不足。本工作旨在回答两个问题:1) 当今的视频生成模型能否有效地遵循提示来创造不可能的视频内容?2) 当今的视频理解模型是否足以理解不可能的视频?为此,我们推出 IPV-Bench,这是一个旨在评估并推动视频理解与生成进展的新颖基准。IPV-Bench 建立在一个全面的分类体系之上,涵盖 4 个领域、14 个类别。它包含多种违背物理、生物、地理或社会规律的多样化场景。基于该分类体系,我们构建了一套提示集以评估视频生成模型,挑战其遵循提示与创造能力。此外,我们还策划了一个视频基准,用于评估 Video-LLMs 在理解不可能视频方面的能力,这尤其需要对其时间动态与世界知识进行推理。全面的评估揭示了视频模型的局限性,并为未来发展方向提供了洞见,为下一代视频模型铺平道路。

关键词

引用

@article{arxiv.2503.14378,
  title  = {Impossible Videos},
  author = {Zechen Bai and Hai Ci and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2503.14378},
  year   = {2025}
}

备注

26 pages