中文

基于片段的自然语言视频定位网络

计算与语言 2020-06-16 v2 计算机视觉与模式识别

摘要

给定一段未裁剪视频和一个文本查询,自然语言视频定位(NLVL)旨在从视频中定位出在语义上对应于该查询的匹配片段。现有方案或将NLVL表述为排序任务并采用多模态匹配架构,或将其作为回归任务直接回归目标视频片段。在本工作中,我们将输入视频视为文本段落,以基于片段的问答(QA)方法处理NLVL任务。我们在标准基于片段的QA框架之上提出一种视频片段定位网络(VSLNet)来解决NLVL。所提出的VSLNet通过一种简单而有效的查询引导高亮(QGH)策略来处理NLVL与基于片段的QA之间的差异。QGH引导VSLNet在高亮区域内搜索匹配的视频片段。通过在三个基准数据集上的大量实验,我们表明所提出的VSLNet优于当前最先进(state-of-the-art, SOTA)的方法;并且采用基于片段的QA框架是解决NLVL的一个有前景的方向。

关键词

引用

@article{arxiv.2004.13931,
  title  = {Span-based Localizing Network for Natural Language Video Localization},
  author = {Hao Zhang and Aixin Sun and Wei Jing and Joey Tianyi Zhou},
  journal= {arXiv preprint arXiv:2004.13931},
  year   = {2020}
}

备注

To appear at ACL 2020