中文

看我所做:教学视频中旁白的自我监督空间定位

计算机视觉与模式识别 2021-12-03 v2 机器学习

摘要

我们提出在视频中对旁白交互进行空间定位的任务。我们方法的关键在于能够利用伴随转录旁白的大型视频语料库以自监督方式学习空间定位交互。为实现该目标,我们提出一种多层跨模态注意力网络,可在训练期间有效优化对比损失。我们引入一种交替计算视觉与自然语言模态间模态内与模态间注意力的分割策略,从而通过直接对比两模态的表示实现有效训练。我们通过在 HowTo100M 教学视频数据集上自训练并在新收集的 YouCook2 数据集中局部描述交互数据集上评估来展示方法的有效性。我们表明我们的方法优于包括浅层共注意力与全跨模态注意力在内的替代基线。我们还将我们的方法应用于图像中短语定位,在 Flickr30K 上以弱监督方式进行,并表明堆叠多个注意力层是有效的,且与词到区域损失结合时在 recall-at-one 与 pointing hand 准确率上达到最先进水平。

关键词

引用

@article{arxiv.2110.10596,
  title  = {Look at What I'm Doing: Self-Supervised Spatial Grounding of Narrations in Instructional Videos},
  author = {Reuben Tan and Bryan A. Plummer and Kate Saenko and Hailin Jin and Bryan Russell},
  journal= {arXiv preprint arXiv:2110.10596},
  year   = {2021}
}

备注

Accepted at NeurIPS 2021 (Spotlight)