中文

基于双重对比学习的交互式视频定位

计算机视觉与模式识别 2021-07-08 v2 计算与语言

摘要

视频定位旨在为给定文本查询从未剪辑视频中定位一个片段。现有方法更多关注视觉与语言刺激的对齐,采用各种基于似然的匹配或回归策略,即P(Y|X)。因此,由于数据集的选择偏差,这些模型可能受到语言与视频特征之间虚假相关性的影响。1)为揭示模型与数据背后的因果关系,我们首先从因果推断的视角提出一种新范式,即交互式视频定位(IVG),其利用后门调整基于结构因果模型(SCM)和do-微积分P(Y|do(X))来消除选择偏差的混杂。然后,我们提出一种简单而有效的方法近似未观测混杂因子,因其无法从数据集中直接采样。2)同时,我们引入双重对比学习方法(DCL),通过最大化查询与视频片段之间的互信息(MI),以及目标片段起止帧与视频内其他帧之间的MI,来更好地对齐文本与视频,并学习更具信息量的视觉表示。在三个标准基准上的实验表明了我们所提方法的有效性。我们的代码已在GitHub上提供:https://github.com/nanguoshun/IVG。

关键词

引用

@article{arxiv.2106.11013,
  title  = {Interventional Video Grounding with Dual Contrastive Learning},
  author = {Guoshun Nan and Rui Qiao and Yao Xiao and Jun Liu and Sicong Leng and Hao Zhang and Wei Lu},
  journal= {arXiv preprint arXiv:2106.11013},
  year   = {2021}
}

备注

Accepted in CVPR 2021