中文

千帧输入与十亿参数端到端时序动作检测

计算机视觉与模式识别 2024-04-23 v2

摘要

近年来,时序动作检测(TAD)在端到端训练下取得了显著的性能提升。然而,由于内存瓶颈,仅有规模和训练数据量受限的模型能够进行端到端训练,这不可避免地限制了 TAD 性能。本文中,我们降低了端到端训练的内存消耗,并将 TAD 主干网络扩展至 10 亿参数、输入视频扩展至 1,536 帧,从而带来显著的检测性能。我们方法的关键在于所提出的时间信息适配器(TIA),这是一种降低训练内存的新型轻量模块。利用 TIA,我们仅更新 TIA 中的参数,使庞大的主干网络免于学习适应 TAD 任务。TIA 还通过在整个主干中聚合相邻帧的时序上下文,带来更好的 TAD 表征。我们在四个代表性数据集上评估了我们的模型。得益于高效设计,我们能够在 VideoMAEv2-giant 上端到端训练,并在 THUMOS14 上达到 75.4% mAP,成为首个超越最佳基于特征方法的端到端模型。代码见 https://github.com/sming256/AdaTAD。

关键词

引用

@article{arxiv.2311.17241,
  title  = {End-to-End Temporal Action Detection with 1B Parameters Across 1000 Frames},
  author = {Shuming Liu and Chen-Lin Zhang and Chen Zhao and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2311.17241},
  year   = {2024}
}

备注

Accepted to CVPR 2024. Camera-Ready Version