中文

自适应聚焦用于高效视频识别

计算机视觉与模式识别 2021-08-19 v2 机器学习 图像与视频处理

摘要

本文中,我们探究视频识别中的空间冗余,旨在提升计算效率。观察到视频每帧中信息最丰富的区域通常是一个小的图像块,且其在帧间平滑移动。因此,我们将图像块定位问题建模为序列决策任务,并提出一种基于强化学习的高效空间自适应视频识别方法(AdaFocus)。具体而言,首先采用轻量卷积网络快速处理完整视频序列,其特征是供循环策略网络定位与任务最相关的区域。随后所选图像块由高容量网络推断以得到最终预测。在离线推理时,一旦生成信息图像块序列,大量计算可并行完成,在现代 GPU 设备上十分高效。此外,我们展示所提方法可通过进一步考虑时间冗余(如动态跳过价值较低的帧)轻松扩展。在五个基准数据集 ActivityNet、FCVID、Mini-Kinetics、Something-Something V1&V2 上的大量实验表明,我们的方法比有竞争力的基线显著更高效。代码见 https://github.com/blackfeather-wang/AdaFocus。

关键词

引用

@article{arxiv.2105.03245,
  title  = {Adaptive Focus for Efficient Video Recognition},
  author = {Yulin Wang and Zhaoxi Chen and Haojun Jiang and Shiji Song and Yizeng Han and Gao Huang},
  journal= {arXiv preprint arXiv:2105.03245},
  year   = {2021}
}

备注

ICCV 2021 (oral presentation)