中文

基于自然语言查询的视频时刻检索

计算机视觉与模式识别 2020-09-11 v2 人工智能 计算与语言 机器学习

摘要

本文中,我们提出一种新颖的视频时刻检索(VMR)方法,在 R@1 指标上达到最先进(SOTA)性能,并在高 IoU 指标(R@1, IoU=0.7)上超越 SOTA。首先,我们提出使用多头自注意力机制,并进一步采用交叉注意力方案,从视频上下文中捕捉视频/查询交互与长程查询依赖。基于注意力的方法可在任意位置发展帧到查询和查询到帧的交互,多头设置确保对复杂依赖的充分理解。我们的模型架构简单,在保持性能的同时实现更快的训练与推理。其次,我们提出使用由时刻分割任务、起止分布预测与起止位置回归任务组成的多任务训练目标。我们已验证,由于标注者分歧,起止预测存在噪声,而与时刻分割任务联合训练可提供更丰富信息,因为目标片段内的帧也用作正训练样本。第三,我们提出使用早期融合方法,以推理时间为代价获得更好性能。然而,推理时间对我们模型而言不是问题,因为我们的模型架构简单,可实现高效训练与推理。

关键词

引用

@article{arxiv.2009.02406,
  title  = {Video Moment Retrieval via Natural Language Queries},
  author = {Xinli Yu and Mohsen Malmir and Cynthia He and Yue Liu and Rex Wu},
  journal= {arXiv preprint arXiv:2009.02406},
  year   = {2020}
}

备注

needs internal approval