SnAG:可扩展且精确的视频时序定位
计算机视觉与模式识别
2024-04-08 v2
摘要
视频中文本描述的时序定位是视觉-语言学习和视频理解中的一个核心问题。现有方法通常优先考虑准确性而非可扩展性——它们被优化为仅在短视频内定位少数文本查询,无法扩展到具有数百个查询的长视频。在本文中,我们研究了跨模态融合对视频时序定位模型可扩展性的影响。我们的分析确立晚期融合作为一种对于具有大量文本查询的长视频更具成本效益的融合方案。此外,它引导我们提出了一种用于高效训练的、以视频为中心的新型采样方案。基于这些发现,我们提出了 SnAG,一个用于可扩展且精确的视频时序定位的简单基线。无需任何花哨技巧,SnAG 比长视频时序定位的 SOTA 方法 CONE 在具有挑战性的 MAD 数据集上准确率高出 43%,速度快 1.5 倍,同时在短视频上取得了极具竞争力的结果。
引用
@article{arxiv.2404.02257,
title = {SnAG: Scalable and Accurate Video Grounding},
author = {Fangzhou Mu and Sicheng Mo and Yin Li},
journal= {arXiv preprint arXiv:2404.02257},
year = {2024}
}
备注
Accepted to CVPR 2024. Code available at https://github.com/fmu2/snag_release