中文

时光丢失:面向视频LLM的新型时序基准

计算机视觉与模式识别 2025-03-26 v3

摘要

大型语言模型已在与视觉模型集成后展现出惊人的性能,甚至实现了视频理解。然而,评估视频模型自身也存在独特挑战,已提出多种基准进行解决。本文指出,当前最常用的视频语言基准几乎无需进行复杂的时序推理即可解决。我们识别出现有数据集的三个主要问题:(i)来自单个帧的静态信息常常足以解决任务;(ii)问题和候选答案的文本信息过于详尽,允许模型在不依赖任何视觉输入的情况下正确回答;(iii)世界知识本身即可回答许多问题,使基准成为知识复制而非视频推理的测试。此外,我们发现面向视频理解的开放式问答基准也存在类似问题,而基于LLM的自动评估过程不可靠,不适合作为替代方案。作为解决方案,我们提出TVBench,一个新的开源视频多选问答基准,证明其需要高度的时序理解。令人惊讶的是,我们发现大多数最新SOTA视频语言模型在TVBench上的表现与随机性能相似,只有少数模型如Qwen2-VL和Tarsier明显超越了这一基准。

关键词

引用

@article{arxiv.2410.07752,
  title  = {Lost in Time: A New Temporal Benchmark for VideoLLMs},
  author = {Daniel Cores and Michael Dorkenwald and Manuel Mucientes and Cees G. M. Snoek and Yuki M. Asano},
  journal= {arXiv preprint arXiv:2410.07752},
  year   = {2025}
}