中文

基于多模态引导的长视频时刻定位

计算机视觉与模式识别 2023-10-17 v2 人工智能 机器学习

摘要

近期大规模长视频 MAD 与 Ego4D 数据集的引入使研究者能够考察当前最先进方法在长视频设定下视频定位的性能,并得出有趣发现:由于无法处理长视频序列,当前单纯的定位方法在该具挑战性任务与设定下失效。本文提出一种通过识别并剪除不可描述窗口来提升长视频中自然语言定位性能的方法。我们设计了一个由引导模型与基础定位模型组成的引导式定位框架。引导模型强调可描述窗口,而基础定位模型分析短时时间窗口以确定哪些片段准确匹配给定语言查询。我们为引导模型提供两种设计:查询无关(Query-Agnostic)与查询依赖(Query-Dependent),以平衡效率与精度。实验表明,我们所提方法在 MAD 与 Ego4D(NLQ)上分别超越 SOTA 模型 4.1% 与 4.52%。用于复现实验的代码、数据及 MAD 的音频特征见:https://github.com/waybarrios/guidance-based-video-grounding。

关键词

引用

@article{arxiv.2302.13372,
  title  = {Localizing Moments in Long Video Via Multimodal Guidance},
  author = {Wayner Barrios and Mattia Soldan and Alberto Mario Ceballos-Arroyo and Fabian Caba Heilbron and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2302.13372},
  year   = {2023}
}