中文

弱监督下视频中自然语句的时空定位

计算机视觉与模式识别 2019-06-07 v1

摘要

在本文中,我们处理一项新任务,即弱监督下视频中自然语句的时空定位。具体而言,给定自然语句和视频,我们在视频中定位一个在语义上对应于给定语句的时空管,训练期间不依赖任何时空标注。首先,从视频中提取一组称为实例的时空管。然后,我们使用我们提出的注意力交互器对这些实例和语句进行编码,该交互器可利用其细粒度关系来刻画其匹配行为。除排序损失外,引入了一种新的多样性损失来训练所提出的注意力交互器,以加强可靠实例-语句对的匹配行为并惩罚不可靠的配对。此外,我们还基于ImageNet视频目标检测数据集贡献了一个称为VID-sentence的数据集,作为我们任务的基准。大量实验结果证明了我们的模型相对于基线方法的优越性。

关键词

引用

@article{arxiv.1906.02549,
  title  = {Weakly-Supervised Spatio-Temporally Grounding Natural Sentence in Video},
  author = {Zhenfang Chen and Lin Ma and Wenhan Luo and Kwan-Yee K. Wong},
  journal= {arXiv preprint arXiv:1906.02549},
  year   = {2019}
}