基于自然语言查询的视频时刻检索
计算机视觉与模式识别
2020-09-11 v2 人工智能
计算与语言
机器学习
摘要
本文中,我们提出一种新颖的视频时刻检索(VMR)方法,在 R@1 指标上达到最先进(SOTA)性能,并在高 IoU 指标(R@1, IoU=0.7)上超越 SOTA。首先,我们提出使用多头自注意力机制,并进一步采用交叉注意力方案,从视频上下文中捕捉视频/查询交互与长程查询依赖。基于注意力的方法可在任意位置发展帧到查询和查询到帧的交互,多头设置确保对复杂依赖的充分理解。我们的模型架构简单,在保持性能的同时实现更快的训练与推理。其次,我们提出使用由时刻分割任务、起止分布预测与起止位置回归任务组成的多任务训练目标。我们已验证,由于标注者分歧,起止预测存在噪声,而与时刻分割任务联合训练可提供更丰富信息,因为目标片段内的帧也用作正训练样本。第三,我们提出使用早期融合方法,以推理时间为代价获得更好性能。然而,推理时间对我们模型而言不是问题,因为我们的模型架构简单,可实现高效训练与推理。
引用
@article{arxiv.2009.02406,
title = {Video Moment Retrieval via Natural Language Queries},
author = {Xinli Yu and Mohsen Malmir and Cynthia He and Yue Liu and Rex Wu},
journal= {arXiv preprint arXiv:2009.02406},
year = {2020}
}
备注
needs internal approval