细看以准定位:视频中句子的弱监督时间定位
计算机视觉与模式识别
2020-01-28 v1
摘要
在本文中,我们研究视频中句子的弱监督时间定位问题。具体而言,给定一个未裁剪视频和一条查询句子,我们的目标是在视频中定位一个与查询句子语义对应的时间段,且在训练时不依赖任何时间标注。我们提出一个两阶段模型以由粗到精的方式解决该问题。在粗阶段,我们首先利用多尺度滑动窗口生成一组固定长度的时间提议,并将它们的视觉特征与句子特征匹配,以识别出最佳匹配提议作为粗定位结果。在精阶段,我们对最佳匹配提议中各帧的视觉特征与句子特征进行细粒度匹配,以定位精定位结果的精确帧边界。在 ActivityNet Captions 数据集和 Charades-STA 数据集上的综合实验表明,我们的两阶段模型取得了引人注目的性能。
引用
@article{arxiv.2001.09308,
title = {Look Closer to Ground Better: Weakly-Supervised Temporal Grounding of Sentence in Video},
author = {Zhenfang Chen and Lin Ma and Wenhan Luo and Peng Tang and Kwan-Yee K. Wong},
journal= {arXiv preprint arXiv:2001.09308},
year = {2020}
}