扫视与聚焦:一种降低图像分类中空间冗余的动态方法
计算机视觉与模式识别
2020-10-13 v1 人工智能
机器学习
摘要
深度卷积神经网络 (CNNs) 的精度通常在输入高分辨率图像时会提升。然而,这往往伴随着高昂的计算代价与内存占用。受并非图像中所有区域都与任务相关这一事实的启发,我们提出了一种新颖的框架,通过处理一系列相对较小的输入来实现高效图像分类,这些输入利用强化学习从原始图像中策略性地选取。这种动态决策过程天然地促进了测试时的自适应推理,即一旦模型对其预测足够置信便可终止,从而避免进一步的冗余计算。值得注意的是,我们的框架具有通用性与灵活性,因为它与大多数最先进的轻量化 CNN(如 MobileNets、EfficientNets 和 RegNets)兼容,可便捷地部署为骨干特征提取器。在 ImageNet 上的实验表明,我们的方法持续提升多种深度模型的计算效率。例如,它在不损失精度的情况下,将 iPhone XS Max 上高效能的 MobileNet-V3 的平均延迟进一步降低 20%。代码与预训练模型可在 https://github.com/blackfeather-wang/GFNet-Pytorch 获取。
引用
@article{arxiv.2010.05300,
title = {Glance and Focus: a Dynamic Approach to Reducing Spatial Redundancy in Image Classification},
author = {Yulin Wang and Kangchen Lv and Rui Huang and Shiji Song and Le Yang and Gao Huang},
journal= {arXiv preprint arXiv:2010.05300},
year = {2020}
}
备注
Accepted by NeurIPS 2020