面向可扩展图像分类的硬注意力方法
计算机视觉与模式识别
2021-11-01 v2
摘要
我们能否在不承受随输入规模呈二次方增长的不可持续复杂度的前提下,利用高分辨率信息?我们提出 Traversal Network (TNet),一种新颖的多尺度硬注意力架构,它以自顶向下的方式遍历图像尺度空间,沿途仅访问信息量最大的图像区域。TNet 通过改变所关注图像位置的数量,提供准确率与复杂度之间的可调权衡。我们在 ImageNet 上将我们的模型与硬注意力基线进行比较,以更少的资源(FLOPs、处理时间与内存)实现了更高的准确率。我们进一步在 fMoW 数据集上测试我们的模型,处理尺寸高达 px 的卫星图像,与在相同分辨率下运行的基线相比,处理速度最高快 倍,同时准确率也更高。TNet 是模块化的,意味着大多数分类模型均可作为其骨干网络用于特征提取,使得所报告的性能提升与现有优化深度模型带来的益处相互正交。最后,硬注意力为我们的模型预测提供了一定程度的可解释性,除推理外无任何额外成本。代码见 。
引用
@article{arxiv.2102.10212,
title = {Hard-Attention for Scalable Image Classification},
author = {Athanasios Papadopoulos and Paweł Korus and Nasir Memon},
journal= {arXiv preprint arXiv:2102.10212},
year = {2021}
}