LoGAN:用于弱监督视频时刻检索的隐图协同注意力网络
计算机视觉与模式识别
2020-03-31 v2 机器学习
图像与视频处理
摘要
弱监督视频时刻检索的目标是在训练时无需时间标注的情况下,定位与给定自然语言查询最相关的视频片段。先前的强监督与弱监督方法常利用协同注意力机制学习用于定位的视觉-语义表示。然而,此类方法往往侧重于识别视频与语言模态元素间的关系,而较少强调在查询语义语境下对视频帧间关系上下文的建模。因此,基于局部帧特征构建的上述视觉-语义表示包含较少上下文信息。为克服该局限,我们提出隐图协同注意力网络(LoGAN),其利用细粒度逐帧-逐词交互,在查询语义语境下推断所有可能帧对之间的对应关系。在 DiDeMo 与 Charades-Sta 两个数据集上的综合实验证明了我们所提隐协同注意力模型的有效性,其以显著优势超越当前最优(SOTA)的弱监督方法。值得注意的是,在 DiDeMo 上其相对强监督 SOTA 方法的 Recall@1 准确率甚至提升了 11%。
引用
@article{arxiv.1909.13784,
title = {LoGAN: Latent Graph Co-Attention Network for Weakly-Supervised Video Moment Retrieval},
author = {Reuben Tan and Huijuan Xu and Kate Saenko and Bryan A. Plummer},
journal= {arXiv preprint arXiv:1909.13784},
year = {2020}
}