DeCafNet:基于委托与征服策略的长视频时序 grounding 高效方法
计算机视觉与模式识别
2025-05-23 v1 人工智能
摘要
长视频时序 grounding(LVTG)旨在基于用户提供的文本查询在冗长视频中识别特定时刻,以实现有效的内容检索。现有方法通过将视频划分为片段并通过全规模专家编码器处理每个片段的做法,面临在长视频中处理大量片段的计算成本高的问题。为此,我们引入DeCafNet,采用“委托与征服”策略,在不牺牲 grounding 性能的情况下实现计算效率。DeCafNet引入一个侧车编码器,对所有视频片段进行资源高效的稠密特征提取,同时生成显著性图以识别供专家编码器完全处理的最相关片段。为有效利用来自侧车和专家编码器的特征(它们在不同的时间分辨率下),我们引入DeCaf-Grounder,通过查询感知时序聚合和多尺度时序细化来统一和细化这些特征,以实现精准的grounding。在两个LVTG基准数据集上的实验表明,DeCafNet在处理能力和性能方面均优于现有方法,同时将计算量降低最高可达47%,在LVTG的效率和性能方面建立了新的SOTA。我们的代码可在 https://github.com/ZijiaLewisLu/CVPR2025-DeCafNet 查阅。
关键词
引用
@article{arxiv.2505.16376,
title = {DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos},
author = {Zijia Lu and A S M Iftekhar and Gaurav Mittal and Tianjian Meng and Xiawei Wang and Cheng Zhao and Rohith Kukkala and Ehsan Elhamifar and Mei Chen},
journal= {arXiv preprint arXiv:2505.16376},
year = {2025}
}
备注
Accepted by CVPR 2025