ViLMA:视频语言模型中语言与时态定位的零样本基准
计算与语言
2023-11-14 v1 人工智能
计算机视觉与模式识别
摘要
随着预训练视频语言模型(VidLM)日益流行,迫切需要对这些模型的视觉-语言能力进行更深入评估的稳健方法论。为应对此挑战,我们提出 ViLMA(视频语言模型评估),一个任务无关的基准,将此类模型细粒度能力的评估置于坚实基础之上。基于任务的评估虽有价值,却未能捕捉 VidLM 需处理的运动图像的复杂性与特定时态方面。通过精心构建的反事实样本,ViLMA 提供了一套受控评估套件,揭示了这些模型的真实潜力及其相对于人类水平理解的性能差距。ViLMA 还包括熟练度测试,评估被视为解决主要反事实测试所必需的基本能力。我们表明,当前 VidLM 的定位能力并不优于使用静态图像的视觉-语言模型,一旦将熟练度测试上的表现纳入考量,这一点尤为惊人。我们的基准可作为未来 VidLM 研究的催化剂,有助于凸显仍待探索的领域。
引用
@article{arxiv.2311.07022,
title = {ViLMA: A Zero-Shot Benchmark for Linguistic and Temporal Grounding in Video-Language Models},
author = {Ilker Kesen and Andrea Pedrotti and Mustafa Dogan and Michele Cafagna and Emre Can Acikgoz and Letitia Parcalabescu and Iacer Calixto and Anette Frank and Albert Gatt and Aykut Erdem and Erkut Erdem},
journal= {arXiv preprint arXiv:2311.07022},
year = {2023}
}
备注
Preprint. 48 pages, 22 figures, 10 tables