中文

基于引导注意力在视频中无候选框的自然语言查询时间片段定位

计算机视觉与模式识别 2020-03-13 v2

摘要

本文研究在长未剪辑视频中使用自然语言作为查询进行时间片段定位的问题。给定一段未剪辑视频和一句查询语句,目标是确定视频中与查询句相关的视觉片段的起始和结束时间。先前工作通过提出-排序(propose-and-rank)方法处理该任务,我们引入一种更高效、端到端可训练且无需候选框的方法,其依赖于三个关键组件:将语言信息迁移至视觉域的动态滤波器、引导模型关注视频最相关部分的新型损失函数,以及用于建模标注不确定性的软标签。我们在两个基准数据集 Charades-STA 和 ActivityNet-Captions 上评估了我们的方法。实验结果表明,我们的方法在两个数据集上均优于 SOTA 方法。

关键词

引用

@article{arxiv.1908.07236,
  title  = {Proposal-free Temporal Moment Localization of a Natural-Language Query in Video using Guided Attention},
  author = {Cristian Rodriguez-Opazo and Edison Marrese-Taylor and Fatemeh Sadat Saleh and Hongdong Li and Stephen Gould},
  journal= {arXiv preprint arXiv:1908.07236},
  year   = {2020}
}

备注

Winter Conference on Applications of Computer Vision 2020