中文

ETAD:在笔记本电脑上端到端训练动作检测

计算机视觉与模式识别 2022-11-29 v2

摘要

时序动作检测(TAD)的端到端训练常因视频时长较长而对计算资源需求巨大而备受困扰。本工作中,我们提出了一种高效的时序动作检测器(ETAD),可直接从视频帧训练且 GPU 内存消耗极低。我们的主要思想是在每次训练迭代中最小化并平衡特征与梯度上的繁重计算。我们提出将片段帧顺序通过视频编码器前向传播,并仅反向传播一小部分必要梯度以更新编码器。为进一步缓解训练中的计算冗余,我们提出在训练期间动态采样仅一小部分提议。此外,针对编码器和检测器研究了多种采样策略与比例。ETAD 在 TAD 基准上以显著效率取得了最先进性能。在 ActivityNet-1.3 上,端到端训练下 ETAD 训练 18 小时即可达到 38.25% 的平均 mAP,且每视频仅消耗 1.3 GB 内存。我们的代码将公开发布。

关键词

引用

@article{arxiv.2205.07134,
  title  = {ETAD: Training Action Detection End to End on a Laptop},
  author = {Shuming Liu and Mengmeng Xu and Chen Zhao and Xu Zhao and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2205.07134},
  year   = {2022}
}