FlashVTG:用于视频时间定位的特征分层与自适应分数处理网络
计算机视觉与模式识别
2024-12-19 v1 人工智能
计算与语言
摘要
文本引导的视频时间定位(VTG)旨在基于文本描述在未修剪视频中定位相关片段,包含两个子任务:时刻检索(MR)和高亮检测(HD)。尽管以往的典型方法取得了可观的成果,但检索短视频时刻仍然具有挑战性。这主要是由于依赖稀疏且有限的解码器查询,这严重限制了预测的准确性。此外,以往方法通常基于孤立预测进行排序,忽略了更广泛的视频上下文,从而导致次优结果。为了解决这些问题,我们引入了FlashVTG,一个包含时间特征分层(TFL)模块和自适应分数精炼(ASR)模块的框架。TFL模块取代了传统的解码器结构,以捕捉多个时间尺度上细微的视频内容变化,而ASR模块通过整合相邻时刻的上下文和多时间尺度特征来改进预测排序。大量实验表明,FlashVTG在四个广泛采用的数据集上的MR和HD任务中均达到了最先进的性能。具体来说,在QVHighlights数据集上,MR的mAP提升了5.8%,HD的mAP提升了3.3%。对于短时刻检索,FlashVTG将mAP提升至先前SOTA性能的125%。所有这些改进均未增加训练负担,凸显了其有效性。我们的代码可在https://github.com/Zhuo-Cao/FlashVTG获取。
引用
@article{arxiv.2412.13441,
title = {FlashVTG: Feature Layering and Adaptive Score Handling Network for Video Temporal Grounding},
author = {Zhuo Cao and Bingqing Zhang and Heming Du and Xin Yu and Xue Li and Sen Wang},
journal= {arXiv preprint arXiv:2412.13441},
year = {2024}
}
备注
Accepted to WACV 2025