Video-GroundingDINO:迈向开放词汇的时空视频定位
计算机视觉与模式识别
2024-04-02 v2
摘要
视频定位旨在定位视频中与输入文本查询相对应的时空片段。本文通过引入开放词汇的时空视频定位任务,解决了当前视频定位方法中的一个关键局限性。与因训练数据有限和预定义词汇而在开放词汇场景中难以应对的流行封闭集方法不同,我们的模型利用来自基础空间定位模型的预训练表示。这使其能够有效弥合自然语言与多样化视觉内容之间的语义差距,在封闭集和开放词汇设置中均实现了强劲性能。我们的贡献包括一个新颖的时空视频定位模型,在多个数据集的封闭集评估中超越了最先进的结果,并在开放词汇场景中展示了卓越的性能。值得注意的是,所提出的模型在VidSTG(陈述式和疑问式)和HC-STVG(V1和V2)数据集的封闭集设置中优于最先进的方法。此外,在HC-STVG V1和YouCook-Interactions的开放词汇评估中,我们的模型以4.88 m_vIoU和1.83%的准确率超越了近期最佳模型,展示了其在处理多样化语言和视觉概念以改进视频理解方面的有效性。我们的代码将公开发布。
引用
@article{arxiv.2401.00901,
title = {Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding},
author = {Syed Talal Wasim and Muzammal Naseer and Salman Khan and Ming-Hsuan Yang and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2401.00901},
year = {2024}
}