中文

MS-DETR:基于采样时刻-时刻交互的自然语言视频定位

计算机视觉与模式识别 2023-08-22 v1

摘要

给定查询语句,自然语言视频定位(NLVL)任务旨在未裁剪视频中定位与查询语义匹配的时间时刻。本文采用基于提案的解决方案,先生成提案(即候选时刻)再选择最佳匹配提案。在对候选时刻与查询之间的跨模态交互建模之外,我们提出的 Moment Sampling DETR(MS-DETR)实现了高效的时刻-时刻关系建模。其核心思想是在采用的 DETR(DEtection TRansformer)框架下,由可学习模板引导对时刻子集进行采样。为此,我们设计了多尺度视觉-语言编码器,以及与一组可学习模板配对的锚点引导时刻解码器。在三个公开数据集上的实验结果证明了 MS-DETR 的优越性能。

关键词

引用

@article{arxiv.2305.18969,
  title  = {MS-DETR: Natural Language Video Localization with Sampling Moment-Moment Interaction},
  author = {Jing Wang and Aixin Sun and Hao Zhang and Xiaoli Li},
  journal= {arXiv preprint arXiv:2305.18969},
  year   = {2023}
}

备注

Accepted by ACL 2023