高效视频时间 grounding 的稀疏-稠密侧调谐器
计算机视觉与模式识别
2025-07-11 v1
摘要
视频时间 grounding(VTG)涉及基于文本查询的时刻检索(Moment Retrieval, MR)和高亮检测(Highlight Detection, HD)。目前大多数方法仅依赖冻结的大型预训练主干网络的最末层特征,限制了其在新领域的适应性。虽然完整微调往往不切实际,但参数高效微调——特别是侧微调(ST)——已成为有效的替代方案。然而,现有ST方法从帧级细化角度解决此问题,忽略了MR的内在稀疏性。为此,我们提出了稀疏-稠密侧调谐器(SDST),VTG领域首个无锚点ST架构。我们还引入了参考可变形自注意力机制,以增强可变形注意力的上下文建模——这是现有无锚点方法的一个关键局限。此外,我们首次将InternVideo2主干网络集成到ST框架中,显示出在性能上的深远影响。总体而言,我们的方法显著改进了现有ST方法,在QVHighlights、TACoS和Charades-STA上实现了高度具竞争力或SOTA的结果,同时将参数数量降低最高达73%。我们的代码已公开访问:https://github.com/davidpujol/SDST。
引用
@article{arxiv.2507.07744,
title = {Sparse-Dense Side-Tuner for efficient Video Temporal Grounding},
author = {David Pujol-Perich and Sergio Escalera and Albert Clapés},
journal= {arXiv preprint arXiv:2507.07744},
year = {2025}
}