中文

输入梯度是否凸显判别性特征?

机器学习 2021-10-27 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

基于梯度的后验可解释性方法[Simonyan et al., 2013, Smilkov et al., 2017]提供模型预测的实例级解释,通常基于假设(A):输入梯度——即logits相对于输入的梯度——的幅值会以含噪方式凸显与任务相关的判别性特征。本文采用三管齐下的方法检验假设(A)的有效性。首先,我们开发了一个评估框架DiffROAR,在四个图像分类基准上检验假设(A)。我们的结果表明:(i)标准模型(即在原始数据上训练的模型)的输入梯度可能严重违背(A),而(ii)对抗鲁棒模型的输入梯度满足(A)。其次,我们引入了BlockMNIST,一个基于MNIST的半真实数据集,其设计在本质上编码了判别性特征的先验知识。我们在BlockMNIST上的分析利用该信息验证并刻画了标准模型与鲁棒模型输入梯度归因之间的差异。最后,我们从理论上证明我们的实证发现在BlockMNIST的简化版本上成立。具体而言,我们证明在该数据集上训练的标准单隐层MLP的输入梯度并不凸显实例特定的信号坐标,从而严重违背假设(A)。我们的发现促使人们以可证伪的方式形式化并检验可解释性中的常见假设[Leavitt and Morcos, 2020]。我们相信DiffROAR评估框架与基于BlockMNIST的数据集可作为健全性检查,用以审计实例特定的可解释性方法;代码与数据见https://github.com/harshays/inputgradients。

关键词

引用

@article{arxiv.2102.12781,
  title  = {Do Input Gradients Highlight Discriminative Features?},
  author = {Harshay Shah and Prateek Jain and Praneeth Netrapalli},
  journal= {arXiv preprint arXiv:2102.12781},
  year   = {2021}
}

备注

NeurIPS 2021