MS-DETR:基于采样时刻-时刻交互的自然语言视频定位
计算机视觉与模式识别
2023-08-22 v1
摘要
给定查询语句,自然语言视频定位(NLVL)任务旨在未裁剪视频中定位与查询语义匹配的时间时刻。本文采用基于提案的解决方案,先生成提案(即候选时刻)再选择最佳匹配提案。在对候选时刻与查询之间的跨模态交互建模之外,我们提出的 Moment Sampling DETR(MS-DETR)实现了高效的时刻-时刻关系建模。其核心思想是在采用的 DETR(DEtection TRansformer)框架下,由可学习模板引导对时刻子集进行采样。为此,我们设计了多尺度视觉-语言编码器,以及与一组可学习模板配对的锚点引导时刻解码器。在三个公开数据集上的实验结果证明了 MS-DETR 的优越性能。
引用
@article{arxiv.2305.18969,
title = {MS-DETR: Natural Language Video Localization with Sampling Moment-Moment Interaction},
author = {Jing Wang and Aixin Sun and Hao Zhang and Xiaoli Li},
journal= {arXiv preprint arXiv:2305.18969},
year = {2023}
}
备注
Accepted by ACL 2023