面向视频定位的生成引导多级统一网络
计算机视觉与模式识别
2023-03-15 v1 多媒体
摘要
视频定位旨在未裁剪视频中定位与查询描述最匹配的时间戳。主流方法可分为时刻级与片段级框架。时刻级方法从全局视角直接预测每个瞬时时刻作为边界的概率,通常在粗粒度定位中表现更好。另一方面,片段级方法将不同时间窗内的时刻聚合成候选片段,再推断最相似者,从而在细粒度定位上具有优势。本文中,我们提出一种多级统一框架,通过结合时刻级与片段级方法的优点来提升性能。此外,两级均采用了一种新颖的生成引导范式。其引入多模态生成器来产生隐式边界特征与片段特征,随后作为查询由判别器计算边界分数。该生成引导方案将视频定位从双独特模态的匹配任务增强为跨模态注意力任务,走出以往框架并取得显著增益。所提出的生成引导多级统一网络(GMU)在 Charades-STA、ActivityNet captions 等多种具有不同特征的基准上超越以往方法并达到 SOTA。
引用
@article{arxiv.2303.07748,
title = {Generation-Guided Multi-Level Unified Network for Video Grounding},
author = {Xing Cheng and Xiangyu Wu and Dong Shen and Hezheng Lin and Fan Yang},
journal= {arXiv preprint arXiv:2303.07748},
year = {2023}
}