聚光灯:用于识别和定位视频生成错误的视觉-语言模型
计算机视觉与模式识别
2025-11-25 v1
摘要
当前文本到视频模型(T2V)能够生成高质量、时序连贯且视觉上逼真的视频。尽管如此,错误仍经常发生,且比以往 T2V 模型更为细微和局部。虽然当前评估范式在不同维度上对视频进行整体评估,但通常不 identify 具体错误何时发生或其 nature。为弥合这一差距,本文引入了 Spotlight 任务,旨在定位和解释视频生成错误。我们使用 200 个多样化文本提示和三个最先进的视频生成器(Veo 3、Seedance 和 LTX-2)生成 600 个视频,并在六类错误(包括 motion、physics 和 prompt adherence)中标注超过 1600 个细粒度错误。我们观察到,adherence 和 physics 错误在更长的 segment 中占主导地位,而 appearance-disappearance 和 body pose 错误则在较短的 segment 中显现。随后我们评估了当前 VLMs 在 Spotlight 任务中的表现,发现 VLMs 在视频中识别和定位错误方面显著落后于人类。我们提出了推理时间策略来探索当前 VLMs 在本任务中的极限,通过 nearly 2x 提高性能。我们的任务为构建细粒度评估工具和更复杂的奖励模型 for 视频生成器铺平了道路。
引用
@article{arxiv.2511.18102,
title = {Spotlight: Identifying and Localizing Video Generation Errors Using VLMs},
author = {Aditya Chinchure and Sahithya Ravi and Pushkar Shukla and Vered Shwartz and Leonid Sigal},
journal= {arXiv preprint arXiv:2511.18102},
year = {2025}
}