弱监督下视频中自然语句的时空定位
计算机视觉与模式识别
2019-06-07 v1
摘要
在本文中,我们处理一项新任务,即弱监督下视频中自然语句的时空定位。具体而言,给定自然语句和视频,我们在视频中定位一个在语义上对应于给定语句的时空管,训练期间不依赖任何时空标注。首先,从视频中提取一组称为实例的时空管。然后,我们使用我们提出的注意力交互器对这些实例和语句进行编码,该交互器可利用其细粒度关系来刻画其匹配行为。除排序损失外,引入了一种新的多样性损失来训练所提出的注意力交互器,以加强可靠实例-语句对的匹配行为并惩罚不可靠的配对。此外,我们还基于ImageNet视频目标检测数据集贡献了一个称为VID-sentence的数据集,作为我们任务的基准。大量实验结果证明了我们的模型相对于基线方法的优越性。
引用
@article{arxiv.1906.02549,
title = {Weakly-Supervised Spatio-Temporally Grounding Natural Sentence in Video},
author = {Zhenfang Chen and Lin Ma and Wenhan Luo and Kwan-Yee K. Wong},
journal= {arXiv preprint arXiv:1906.02549},
year = {2019}
}