SVBench:面向流式视频理解的时间多轮对话基准测试
计算机视觉与模式识别
2025-11-18 v2
摘要
尽管大型视觉语言模型 (LVLMs) 在现有基准测试上取得了显著进展,但针对其在新兴的长上下文流式视频理解领域的适用性,在合适的评估方面仍存在明显差距。当前的视频理解基准通常强调孤立的单一实例文本输入,未能评估在整个视频流持续时间内维持时间推理的能力。为了解决这些局限性,我们引入了 SVBench,这是一个具有时间多轮问答链的先驱性基准测试,专门设计用于全面评估当前 LVLMs 的流式视频理解能力。我们设计了一个半自动标注流水线,以获取 1,353 个流式视频的 49,979 个问答 (QA) 对,其中包括生成表示视频片段上一系列连续多轮对话的 QA 链,并在连续的 QA 链之间构建时间链接。我们从对话和流式评估中的 14 个模型获得的实验结果表明,虽然闭源的 GPT-4o 优于其他模型,但大多数开源 LVLMs 在长上下文流式视频理解方面存在困难。我们还构建了一个 StreamingChat 模型,它在我们的 SVBench 上显著优于开源 LVLMs,并在各种视觉语言基准测试上取得了相当的性能。我们期望 SVBench 通过提供对当前 LVLMs 的全面深入分析来推进流式视频理解的研究。我们的基准测试和模型可在 https://github.com/sotayang/SVBench 获取。
引用
@article{arxiv.2502.10810,
title = {SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding},
author = {Zhenyu Yang and Yuhang Hu and Zemin Du and Dizhan Xue and Shengsheng Qian and Jiahong Wu and Fan Yang and Weiming Dong and Changsheng Xu},
journal= {arXiv preprint arXiv:2502.10810},
year = {2025}
}
备注
ICLR 2025 Accepted (Spotlight)