动作中的动词:改进视频语言模型中的动词理解
计算机视觉与模式识别
2023-04-14 v1 人工智能
计算与语言
摘要
理解动词对于建模人与物体如何通过时空彼此及环境交互至关重要。近来,基于CLIP的先进视频语言模型被表明动词理解有限且极度依赖名词,限制了其在需要动作与时间理解的真实世界视频应用中的表现。本工作中,我们通过提出一种新颖的动词聚焦对比(VFC)框架,改进基于CLIP的视频语言模型的动词理解。其包含两个主要组件:(1)利用预训练大语言模型(LLM)为跨模态对比学习创建困难负样本,辅以平衡正负对中概念出现的校准策略;以及(2)施加细粒度的动词短语对齐损失。我们的方法在聚焦动词理解的三个下游任务上取得零样本性能的最先进水平(SOTA):视频-文本匹配、视频问答与视频分类。据我们所知,这是首个提出方法缓解动词理解问题而非仅指出该问题的工作。
引用
@article{arxiv.2304.06708,
title = {Verbs in Action: Improving verb understanding in video-language models},
author = {Liliane Momeni and Mathilde Caron and Arsha Nagrani and Andrew Zisserman and Cordelia Schmid},
journal= {arXiv preprint arXiv:2304.06708},
year = {2023}
}