$R^2$-Tuning:面向视频时序定位的高效图像到视频迁移学习
计算机视觉与模式识别
2024-07-23 v2
摘要
视频时序定位是一个细粒度视频理解问题,旨在根据自然语言查询在未剪辑视频中定位相关片段。大多数现有的 VTG 模型建立在逐帧的最后一层 CLIP 特征之上,并由具有复杂时序推理机制的额外时序主干网络(例如 SlowFast)辅助。在本工作中,我们声称 CLIP 本身已经展现出在细粒度时空建模方面的巨大潜力,因为每一层在不同粒度级别下提供了独特且有用的信息。受此启发,我们提出了 Reversed Recurrent Tuning (-Tuning),一种用于视频时序定位的参数高效且内存高效的迁移学习框架。我们的方法学习一个仅包含总参数量 1.5% 的轻量级 Block,以执行渐进式时空建模。从 CLIP 的最后一层开始, Block 循环地聚合来自较早层的空间特征,然后基于给定查询细化时序相关性,形成由粗到细的方案。即使没有额外的骨干网络,-Tuning 在六个公开基准(即 QVHighlights、Charades-STA、Ego4D-NLQ、TACoS、YouTube Highlights 和 TVSum)上的三个 VTG 任务(即时刻检索、高光检测和视频摘要)中均取得了 SOTA 性能,证明了所提方案的重要性和有效性。我们的代码可在 https://github.com/yeliudev/R2-Tuning 获取。
引用
@article{arxiv.2404.00801,
title = {$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding},
author = {Ye Liu and Jixuan He and Wanhua Li and Junsik Kim and Donglai Wei and Hanspeter Pfister and Chang Wen Chen},
journal= {arXiv preprint arXiv:2404.00801},
year = {2024}
}
备注
ECCV 2024 Camera Ready