自然语言视频定位:基于跨度问答框架的再审视
计算与语言
2021-03-03 v3 计算机视觉与模式识别
摘要
自然语言视频定位(NLVL)旨在从未剪辑视频中定位与文本查询在语义上对应的目标片段。现有方法主要从计算机视觉的角度出发,将NLVL问题形式化为排序、锚框或回归任务。这些方法在长视频上定位时性能大幅下降。在本工作中,我们从一个新视角——即基于跨度的问答(QA)——通过将输入视频视为文本段落来解决NLVL。我们提出了一个视频跨度定位网络(VSLNet),构建于标准基于跨度的QA框架(称为VSLBase)之上,以解决NLVL。VSLNet通过一种简单而有效的查询引导高亮(QGH)策略来处理NLVL与基于跨度的QA之间的差异。QGH引导VSLNet在高亮区域内搜索匹配的视频跨度。为解决长视频上的性能下降问题,我们进一步将VSLNet扩展为VSLNet-L,采用多尺度分割与拼接策略。VSLNet-L首先将未剪辑视频分割为短片段;然后,它预测哪个片段包含目标时刻并抑制其他片段的重要性。最后,将这些片段以不同置信度拼接,以准确锁定目标时刻。在三个基准数据集上的大量实验表明,所提出的VSLNet和VSLNet-L优于最先进的方法;VSLNet-L解决了长视频上性能下降的问题。我们的研究表明,基于跨度的QA框架是解决NLVL问题的一种有效策略。
引用
@article{arxiv.2102.13558,
title = {Natural Language Video Localization: A Revisit in Span-based Question Answering Framework},
author = {Hao Zhang and Aixin Sun and Wei Jing and Liangli Zhen and Joey Tianyi Zhou and Rick Siow Mong Goh},
journal= {arXiv preprint arXiv:2102.13558},
year = {2021}
}
备注
15 pages, 18 figures, and 10 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). arXiv admin note: substantial text overlap with arXiv:2004.13931