中文

重新思考基于梯度的归因方法在模型可解释性中的作用

机器学习 2021-03-04 v2 计算机视觉与模式识别 机器学习

摘要

当前用于判别型深度神经网络可解释性的方法通常依赖于模型的输入梯度,即输出 logits 关于输入的梯度。常见的假设是这些输入梯度包含关于 pθ(yx)p_{\theta} ( y \mid x)(模型的判别能力)的信息,从而证明其用于可解释性的合理性。然而,在本文中我们表明,由于 softmax 的平移不变性,这些输入梯度可在不改变判别函数的情况下被任意操纵。这留下了一个开放问题:如果输入梯度可以是任意的,为什么它们在标准模型中却是高度结构化且具有解释性的?我们通过将标准基于 softmax 的分类器的 logits 重新解释为数据分布的非归一化对数密度来研究这一点,并表明输入梯度可被视为判别模型内部隐式的类条件密度模型 pθ(xy)p_{\theta}(x \mid y) 的梯度。这使我们假设,输入梯度的高度结构化与解释性可能源于该类条件模型 pθ(xy)p_{\theta}(x \mid y) 与真实数据分布 pdata(xy)p_{\text{data}} (x \mid y) 的对齐。我们通过研究密度对齐对梯度解释的影响来检验这一假设。为实现该对齐,我们使用分数匹配(score-matching),并提出了该算法的新近似方法以训练大规模模型。我们的实验表明,改善隐式密度模型与数据分布的对齐可增强梯度结构与解释力,而减小该对齐则产生相反效果。总体而言,我们发现输入梯度捕获了关于隐式生成模型的信息,这意味着我们需要重新思考它们用于解释判别模型的方式。

关键词

引用

@article{arxiv.2006.09128,
  title  = {Rethinking the Role of Gradient-Based Attribution Methods for Model Interpretability},
  author = {Suraj Srinivas and Francois Fleuret},
  journal= {arXiv preprint arXiv:2006.09128},
  year   = {2021}
}

备注

Oral Presentation at ICLR 2021