TempCompass:视频大语言模型真的理解视频吗?
计算机视觉与模式识别
2024-06-04 v3
摘要
最近,人们对视频大语言模型(Video LLMs)的兴趣激增。然而,现有的基准测试未能提供关于 Video LLMs 时间感知能力的全面反馈。一方面,大多数模型无法区分不同的时间方面(例如速度、方向),因此无法反映在这些特定方面的细微性能差异。另一方面,它们在任务格式的多样性上受到限制(例如仅限多项选择问答),这阻碍了理解时间感知性能如何在不同类型的任务中变化。受这两个问题的启发,我们提出了\textbf{TempCompass}基准测试,引入了多样化的时间方面和任务格式。为了收集高质量的测试数据,我们设计了两种新策略:(1) 在视频收集中,我们构建了共享相同静态内容但在特定时间方面不同的冲突视频,从而防止 Video LLMs 利用单帧偏差或语言先验。(2) 为了收集任务指令,我们提出了一种范式,即人类首先为视频标注元信息,然后由 LLM 生成指令。我们还设计了一种基于 LLM 的方法来自动且准确地评估 Video LLMs 的响应。基于 TempCompass,我们全面评估了 8 个最先进(SOTA)的 Video LLMs 和 3 个图像 LLMs,并揭示了一个显著的事实:这些模型表现出明显较差的时间感知能力。我们的数据将在 https://github.com/llyx97/TempCompass 提供。
引用
@article{arxiv.2403.00476,
title = {TempCompass: Do Video LLMs Really Understand Videos?},
author = {Yuanxin Liu and Shicheng Li and Yi Liu and Yuxiang Wang and Shuhuai Ren and Lei Li and Sishuo Chen and Xu Sun and Lu Hou},
journal= {arXiv preprint arXiv:2403.00476},
year = {2024}
}