Saccader:提升视觉硬注意力模型的精度
计算机视觉与模式识别
2019-12-10 v3 机器学习
机器学习
摘要
尽管深度卷积神经网络在几乎所有图像分类任务上都达到了最先进的性能,但其决策难以解释。硬注意力(hard attention)是一种从设计上提供一定可解释性的方法,它仅使用图像的相关部分。然而,仅以类别标签监督训练硬注意力模型具有挑战性,且硬注意力难以扩展到复杂数据集。本文中,我们提出一种新颖的硬注意力模型,称之为 Saccader。Saccader 的关键在于一个仅需类别标签的预训练步骤,其为策略梯度优化提供初始注意力位置。我们的最佳模型缩小了与常见 ImageNet 基线的差距,在仅关注不到三分之一图像的情况下达到了 的 top-1 和 的 top-5 精度。
引用
@article{arxiv.1908.07644,
title = {Saccader: Improving Accuracy of Hard Attention Models for Vision},
author = {Gamaleldin F. Elsayed and Simon Kornblith and Quoc V. Le},
journal= {arXiv preprint arXiv:1908.07644},
year = {2019}
}
备注
33rd Conference on Neural Information Processing Systems (NeurIPS 2019), Vancouver, Canada