千帧输入与十亿参数端到端时序动作检测
计算机视觉与模式识别
2024-04-23 v2
摘要
近年来,时序动作检测(TAD)在端到端训练下取得了显著的性能提升。然而,由于内存瓶颈,仅有规模和训练数据量受限的模型能够进行端到端训练,这不可避免地限制了 TAD 性能。本文中,我们降低了端到端训练的内存消耗,并将 TAD 主干网络扩展至 10 亿参数、输入视频扩展至 1,536 帧,从而带来显著的检测性能。我们方法的关键在于所提出的时间信息适配器(TIA),这是一种降低训练内存的新型轻量模块。利用 TIA,我们仅更新 TIA 中的参数,使庞大的主干网络免于学习适应 TAD 任务。TIA 还通过在整个主干中聚合相邻帧的时序上下文,带来更好的 TAD 表征。我们在四个代表性数据集上评估了我们的模型。得益于高效设计,我们能够在 VideoMAEv2-giant 上端到端训练,并在 THUMOS14 上达到 75.4% mAP,成为首个超越最佳基于特征方法的端到端模型。代码见 https://github.com/sming256/AdaTAD。
引用
@article{arxiv.2311.17241,
title = {End-to-End Temporal Action Detection with 1B Parameters Across 1000 Frames},
author = {Shuming Liu and Chen-Lin Zhang and Chen Zhao and Bernard Ghanem},
journal= {arXiv preprint arXiv:2311.17241},
year = {2024}
}
备注
Accepted to CVPR 2024. Camera-Ready Version