中文

用于视频中文本查询定位的弱监督多级注意力重构网络

计算机视觉与模式识别 2020-03-17 v1

摘要

视频中时序定位文本查询的任务是定位与给定查询在语义上对应的一个视频片段。现有大多数方法依赖片段-句子对(时序标注)进行训练,而这些标注在真实场景中通常不可用。在本工作中,我们提出了一种有效的弱监督模型,称为多级注意力重构网络(MARN),其在训练阶段仅依赖视频-句子对。所提方法利用注意力重构的思想,并使用学习到的提议级注意力直接对候选片段打分。此外,另一学习片段级注意力的分支被用于训练和测试阶段细化提议。我们开发了一种新颖的提议采样机制,以利用提议内部信息学习更好的提议表示,并采用 2D 卷积挖掘提议间线索以学习可靠的注意力图。在 Charades-STA 和 ActivityNet-Captions 数据集上的实验证明了我们的 MARN 相对于现有弱监督方法的优越性。

关键词

引用

@article{arxiv.2003.07048,
  title  = {Weakly-Supervised Multi-Level Attentional Reconstruction Network for Grounding Textual Queries in Videos},
  author = {Yijun Song and Jingwen Wang and Lin Ma and Zhou Yu and Jun Yu},
  journal= {arXiv preprint arXiv:2003.07048},
  year   = {2020}
}