VITATECS:用于视频语言模型时间概念理解的诊断数据集
计算机视觉与模式识别
2024-09-24 v2 人工智能
计算与语言
摘要
感知物体如何随时间变化的能力是人类智能的关键要素。然而,由于静态视觉捷径的存在,当前基准无法忠实反映视频语言模型(VidLMs)的时间理解能力。为补救此问题,我们提出 VITATECS,一个用于评估时间概念理解(TEmporal Concept underStanding)的诊断性视频-文本数据集(VIdeo-Text dAtaset)。具体而言,我们首先引入自然语言中的时间概念细粒度分类体系,以诊断 VidLMs 理解不同时间方面的能力。此外,为解耦静态与时间信息之间的关联,我们生成了仅在指定时间方面不同于原始描述的_counterfactual_(反事实)视频描述。我们采用基于大语言模型和人在回路标注的半自动数据收集框架,以高效获取高质量反事实描述。对代表性视频语言理解模型的评估证实了它们在时间理解上的不足,揭示了视频语言研究中需更加重视时间元素的必要性。
引用
@article{arxiv.2311.17404,
title = {VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models},
author = {Shicheng Li and Lei Li and Shuhuai Ren and Yuanxin Liu and Yi Liu and Rundong Gao and Xu Sun and Lu Hou},
journal= {arXiv preprint arXiv:2311.17404},
year = {2024}
}
备注
Accepted by ECCV 2024. 19 pages, 3 figures, 8 tables. Data is available at https://github.com/lscpku/VITATECS