中文

AdaFocus V2:用于视频识别的空间动态网络端到端训练

计算机视觉与模式识别 2022-04-13 v2 人工智能 机器学习

摘要

近期工作表明,通过降低空间冗余可显著提升视频识别的计算效率。作为代表性工作,自适应聚焦方法(AdaFocus)通过动态识别并关注每帧中的信息区域,在准确率与推理速度间取得了良好权衡。然而,AdaFocus 需要复杂的三阶段训练流程(涉及强化学习),导致收敛缓慢且对使用者不友好。本工作通过引入可微的基于插值的图像块选择操作,将 AdaFocus 的训练重构为简单的单阶段算法,从而实现高效的端到端优化。我们进一步提出改进的训练方案,以解决单阶段公式带来的监督缺失、输入多样性和训练稳定性等问题。此外,提出一种条件退出技术,可在 AdaFocus 之上执行时间自适应计算而无需额外训练。在六个基准数据集(即 ActivityNet、FCVID、Mini-Kinetics、Something-Something V1&V2 和 Jester)上的大量实验表明,我们的模型显著优于原始 AdaFocus 及其他有竞争力的基线,同时训练更为简单高效。代码见 https://github.com/LeapLabTHU/AdaFocusV2。

关键词

引用

@article{arxiv.2112.14238,
  title  = {AdaFocus V2: End-to-End Training of Spatial Dynamic Networks for Video Recognition},
  author = {Yulin Wang and Yang Yue and Yuanze Lin and Haojun Jiang and Zihang Lai and Victor Kulikov and Nikita Orlov and Humphrey Shi and Gao Huang},
  journal= {arXiv preprint arXiv:2112.14238},
  year   = {2022}
}

备注

Accepted by CVPR-2022