中文

LoSA:用于扩展端到端时序动作定位的长短期适配器

计算机视觉与模式识别 2024-12-06 v3

摘要

时序动作定位(TAL)涉及在未修剪视频中定位和分类动作片段。大型视频基础模型的出现使得仅使用 RGB 的视频主干在性能上超越了之前需要 RGB 和光流两种模态的方法。利用这些大型模型通常仅限于训练 TAL 头部,因为适应视频主干用于 TAL 所需的 GPU 内存过大。为克服这一限制,我们引入了 LoSA,这是第一个专门为 TAL 设计的内存和参数高效的主干适配器,用于处理未修剪视频。LoSA 通过引入长短期适配器专门针对 TAL,这些适配器在不同时间范围内适应视频主干的中间层。这些适配器与视频主干并行运行,显著减少了内存占用。LoSA 还包括长短期门控融合,该融合策略性地结合了来自视频主干层的这些适配器的输出,以增强提供给 TAL 头部的视频特征。实验表明,LoSA 通过将端到端主干适应扩展到十亿参数以上的模型(如 VideoMAEv2 (ViT-g))并利用它们超越仅头部迁移学习,在标准 TAL 基准 THUMOS-14 和 ActivityNet-v1.3 上显著优于所有现有方法。

关键词

引用

@article{arxiv.2404.01282,
  title  = {LoSA: Long-Short-range Adapter for Scaling End-to-End Temporal Action Localization},
  author = {Akshita Gupta and Gaurav Mittal and Ahmed Magooda and Ye Yu and Graham W. Taylor and Mei Chen},
  journal= {arXiv preprint arXiv:2404.01282},
  year   = {2024}
}

备注

WACV 2025 Accepted