自适应聚焦用于高效视频识别
计算机视觉与模式识别
2021-08-19 v2 机器学习
图像与视频处理
摘要
本文中,我们探究视频识别中的空间冗余,旨在提升计算效率。观察到视频每帧中信息最丰富的区域通常是一个小的图像块,且其在帧间平滑移动。因此,我们将图像块定位问题建模为序列决策任务,并提出一种基于强化学习的高效空间自适应视频识别方法(AdaFocus)。具体而言,首先采用轻量卷积网络快速处理完整视频序列,其特征是供循环策略网络定位与任务最相关的区域。随后所选图像块由高容量网络推断以得到最终预测。在离线推理时,一旦生成信息图像块序列,大量计算可并行完成,在现代 GPU 设备上十分高效。此外,我们展示所提方法可通过进一步考虑时间冗余(如动态跳过价值较低的帧)轻松扩展。在五个基准数据集 ActivityNet、FCVID、Mini-Kinetics、Something-Something V1&V2 上的大量实验表明,我们的方法比有竞争力的基线显著更高效。代码见 https://github.com/blackfeather-wang/AdaFocus。
引用
@article{arxiv.2105.03245,
title = {Adaptive Focus for Efficient Video Recognition},
author = {Yulin Wang and Zhaoxi Chen and Haojun Jiang and Shiji Song and Yizeng Han and Gao Huang},
journal= {arXiv preprint arXiv:2105.03245},
year = {2021}
}
备注
ICCV 2021 (oral presentation)