中文

$R^2$-Tuning:面向视频时序定位的高效图像到视频迁移学习

计算机视觉与模式识别 2024-07-23 v2

摘要

视频时序定位是一个细粒度视频理解问题,旨在根据自然语言查询在未剪辑视频中定位相关片段。大多数现有的 VTG 模型建立在逐帧的最后一层 CLIP 特征之上,并由具有复杂时序推理机制的额外时序主干网络(例如 SlowFast)辅助。在本工作中,我们声称 CLIP 本身已经展现出在细粒度时空建模方面的巨大潜力,因为每一层在不同粒度级别下提供了独特且有用的信息。受此启发,我们提出了 Reversed Recurrent Tuning (R2R^2-Tuning),一种用于视频时序定位的参数高效且内存高效的迁移学习框架。我们的方法学习一个仅包含总参数量 1.5% 的轻量级 R2R^2 Block,以执行渐进式时空建模。从 CLIP 的最后一层开始,R2R^2 Block 循环地聚合来自较早层的空间特征,然后基于给定查询细化时序相关性,形成由粗到细的方案。即使没有额外的骨干网络,R2R^2-Tuning 在六个公开基准(即 QVHighlights、Charades-STA、Ego4D-NLQ、TACoS、YouTube Highlights 和 TVSum)上的三个 VTG 任务(即时刻检索、高光检测和视频摘要)中均取得了 SOTA 性能,证明了所提方案的重要性和有效性。我们的代码可在 https://github.com/yeliudev/R2-Tuning 获取。

关键词

引用

@article{arxiv.2404.00801,
  title  = {$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding},
  author = {Ye Liu and Jixuan He and Wanhua Li and Junsik Kim and Donglai Wei and Hanspeter Pfister and Chang Wen Chen},
  journal= {arXiv preprint arXiv:2404.00801},
  year   = {2024}
}

备注

ECCV 2024 Camera Ready