中文

Grad-CAM:通过基于梯度的定位为深度网络提供视觉解释

计算机视觉与模式识别 2019-12-04 v4 人工智能 机器学习

摘要

我们提出一种技术,为一类广泛的基于 CNN 的模型决策生成“视觉解释”,使其更加透明。我们的方法——梯度加权类激活映射(Grad-CAM),利用流入最终卷积层的任意目标概念的梯度,生成粗略的定位图,突出显示图像中对预测该概念重要的区域。Grad-CAM 适用于多种 CNN 模型家族:(1) 带有全连接层的 CNN,(2) 用于结构化输出的 CNN,(3) 用于多模态输入或强化学习任务的 CNN,无需任何架构更改或重新训练。我们将 Grad-CAM 与细粒度可视化相结合,创建高分辨率的类别判别可视化,并将其应用于现成的图像分类、图像描述和视觉问答(VQA)模型,包括基于 ResNet 的架构。在图像分类模型的背景下,我们的可视化 (a) 有助于洞察其失败模式,(b) 对对抗性图像具有鲁棒性,(c) 在定位任务上优于先前方法,(d) 更忠实于底层模型,(e) 通过识别数据集偏差帮助实现泛化。对于图像描述和 VQA,我们表明即使是非注意力机制的模型也能定位输入。我们设计了一种通过 Grad-CAM 识别重要神经元的方法,并将其与神经元名称结合,为模型决策提供文本解释。最后,我们设计并进行了人类研究,以衡量 Grad-CAM 是否帮助用户对模型预测建立适当的信任,并表明即使两个模型做出相同的预测,Grad-CAM 也能帮助未经训练的用户成功辨别“更强”的模型与“更弱”的模型。我们的代码可在 https://github.com/ramprs/grad-cam/ 获取,演示在 http://gradcam.cloudcv.org,视频在 youtu.be/COjUB9Izk6E。

关键词

引用

@article{arxiv.1610.02391,
  title  = {Grad-CAM: Visual Explanations from Deep Networks via Gradient-based Localization},
  author = {Ramprasaath R. Selvaraju and Michael Cogswell and Abhishek Das and Ramakrishna Vedantam and Devi Parikh and Dhruv Batra},
  journal= {arXiv preprint arXiv:1610.02391},
  year   = {2019}
}

备注

This version was published in International Journal of Computer Vision (IJCV) in 2019; A previous version of the paper was published at International Conference on Computer Vision (ICCV'17)