中文

SPOT! 重新审视用于事件理解的视频-语言模型

计算机视觉与模式识别 2023-12-05 v2 人工智能

摘要

理解视频是多模态学习的一个重要研究课题。利用网络爬取的视频-文本对大规模数据集作为弱监督,已成为学习联合表征的预训练范式,并在视频理解任务中展现出显著潜力。然而,视频可以是多事件且多粒度的,而这些视频-文本对通常仅包含宽泛层面的视频描述。这引发了一个问题:在如此弱的监督下,视频-语言模型中的视频表征能否获得区分文本描述中事实差异并理解细粒度事件的能力?为此,我们引入 SPOT Prober,以基准测试现有视频-语言模型区分事件级差异的能力,作为模型事件理解能力的指标。我们的方法涉及从视频中提取事件为元组(<主体, 谓词, 客体, 属性, 时间戳>),并通过系统性地操纵元组成分来生成错误事件元组。我们用这些正例和负例描述重新评估现有视频-语言模型,发现它们无法区分大多数被操纵的事件。基于我们的发现,我们提出插入这些被操纵的事件描述作为难负样本,并发现它们在增强模型事件理解方面是有效的。

关键词

引用

@article{arxiv.2311.12919,
  title  = {SPOT! Revisiting Video-Language Models for Event Understanding},
  author = {Gengyuan Zhang and Jinhe Bi and Jindong Gu and Yanyu Chen and Volker Tresp},
  journal= {arXiv preprint arXiv:2311.12919},
  year   = {2023}
}