中文

寻找所言之处:基于注意力位置回归的视频时序语句定位

计算机视觉与模式识别 2018-11-06 v4

摘要

给定一段未经裁剪的视频与一句语句描述,时序语句定位旨在自动确定视频中所描述语句的起止时刻。该问题具有挑战性,因为它需要同时理解视频与语句。现有研究主要采用代价高昂的“扫描并定位”框架,忽视了全局视频上下文与语句内的具体细节,而这两者正是该问题的关键所在。本文中,我们提出一种新颖的基于注意力位置回归(ABLR)方法,从全局视角解决时序语句定位。具体而言,为保留上下文信息,ABLR首先通过双向LSTM网络对视频与语句进行编码。随后,引入多模态协同注意力机制,不仅生成反映全局视频结构的视频注意力,还生成突出时序定位关键细节的语句注意力。最后,设计一种新颖的基于注意力的位置回归网络,由前述注意力预测语句查询的时序坐标。ABLR以端到端方式联合训练。在ActivityNet Captions与TACoS数据集上的综合实验证明了所提ABLR方法的有效性与高效性。

关键词

引用

@article{arxiv.1804.07014,
  title  = {To Find Where You Talk: Temporal Sentence Localization in Video with Attention Based Location Regression},
  author = {Yitian Yuan and Tao Mei and Wenwu Zhu},
  journal= {arXiv preprint arXiv:1804.07014},
  year   = {2018}
}