中文

Grad-CAM:你为什么这么说?

机器学习 2017-01-26 v2 计算机视觉与模式识别 机器学习

摘要

我们提出了一种技术,通过可视化对预测“重要”的输入区域——即视觉解释——使基于卷积神经网络(CNN)的模型更加透明。我们的方法称为梯度加权类激活映射(Grad-CAM),它利用特定类别的梯度信息来定位重要区域。这些定位结果与现有的像素空间可视化相结合,创建了一种新颖的高分辨率且具有类别区分性的可视化方法,称为引导 Grad-CAM。这些方法有助于更好地理解基于 CNN 的模型,包括图像描述和视觉问答模型。我们通过衡量视觉解释区分不同类别、激发人类信任的能力以及它们与遮挡图的相关性来评估这些解释。Grad-CAM 为理解基于 CNN 的模型提供了一种新途径。我们已发布代码、托管在 CloudCV 上的在线演示以及此扩展摘要的完整版本。

关键词

引用

@article{arxiv.1611.07450,
  title  = {Grad-CAM: Why did you say that?},
  author = {Ramprasaath R Selvaraju and Abhishek Das and Ramakrishna Vedantam and Michael Cogswell and Devi Parikh and Dhruv Batra},
  journal= {arXiv preprint arXiv:1611.07450},
  year   = {2017}
}

备注

Presented at NIPS 2016 Workshop on Interpretable Machine Learning in Complex Systems. This is an extended abstract version of arXiv:1610.02391 (CVPR format)