中文

VITATECS:用于视频语言模型时间概念理解的诊断数据集

计算机视觉与模式识别 2024-09-24 v2 人工智能 计算与语言

摘要

感知物体如何随时间变化的能力是人类智能的关键要素。然而,由于静态视觉捷径的存在,当前基准无法忠实反映视频语言模型(VidLMs)的时间理解能力。为补救此问题,我们提出 VITATECS,一个用于评估时间概念理解(TEmporal Concept underStanding)的诊断性视频-文本数据集(VIdeo-Text dAtaset)。具体而言,我们首先引入自然语言中的时间概念细粒度分类体系,以诊断 VidLMs 理解不同时间方面的能力。此外,为解耦静态与时间信息之间的关联,我们生成了仅在指定时间方面不同于原始描述的_counterfactual_(反事实)视频描述。我们采用基于大语言模型和人在回路标注的半自动数据收集框架,以高效获取高质量反事实描述。对代表性视频语言理解模型的评估证实了它们在时间理解上的不足,揭示了视频语言研究中需更加重视时间元素的必要性。

关键词

引用

@article{arxiv.2311.17404,
  title  = {VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models},
  author = {Shicheng Li and Lei Li and Shuhuai Ren and Yuanxin Liu and Yi Liu and Rundong Gao and Xu Sun and Lu Hou},
  journal= {arXiv preprint arXiv:2311.17404},
  year   = {2024}
}

备注

Accepted by ECCV 2024. 19 pages, 3 figures, 8 tables. Data is available at https://github.com/lscpku/VITATECS