中文

VLG-Net:用于视频定位的视频-语言图匹配网络

计算机视觉与模式识别 2021-08-17 v2 计算与语言

摘要

在视频中定位语言查询旨在识别与语言查询在语义上相关的时间区间(或时刻)。解决这一具有挑战性的任务需要理解视频和查询的语义内容,并对其多模态交互进行细粒度推理。我们的核心思想是将这一挑战重新表述为一个算法图匹配问题。借助图神经网络的最新进展,我们提出利用图卷积网络对视频和文本信息及其语义对齐进行建模。为了实现跨模态的信息相互交换,我们设计了一种新颖的视频-语言图匹配网络(VLG-Net)来匹配视频图和查询图。其核心组成部分包括分别构建在视频片段和查询词元之上的表示图,用于建模模态内关系。采用图匹配层进行跨模态上下文建模和多模态融合。最后,通过掩码时刻注意力池化融合该时刻的增强片段特征来生成时刻候选。我们在三个广泛使用的视频语言查询时刻时间定位数据集(ActivityNet-Captions、TACoS 和 DiDeMo)上展示了优于最先进定位方法的性能。

关键词

引用

@article{arxiv.2011.10132,
  title  = {VLG-Net: Video-Language Graph Matching Network for Video Grounding},
  author = {Mattia Soldan and Mengmeng Xu and Sisi Qu and Jesper Tegner and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2011.10132},
  year   = {2021}
}

备注

14 pages, 7 figures, In proceeding of the ICCV21 workshop: AI for Creative Video Editing and Understanding 2021