中文

神经网络的可解释性脆弱

机器学习 2018-11-07 v2 机器学习

摘要

为了让机器学习在许多应用中得以部署并受到信任,能够可靠地解释机器学习算法为何做出某些预测至关重要。例如,若某算法将给定病理图像分类为恶性肿瘤,医生可能需要知道图像的哪些部分导致算法做出此分类。因此,如何解释黑盒预测器是一个重要且活跃的研究领域。一个根本性的问题是:我们能在多大程度上信任解释本身?在本文中,我们表明深度学习预测的解释在如下意义下极其脆弱:两个感知上不可区分、具有相同预测标签的输入可能被赋予非常不同的解释。我们在 ImageNet 和 CIFAR-10 上系统性地刻画了几种广泛使用的特征重要性解释方法(显著图、相关性传播和 DeepLIFT)的脆弱性。我们的实验表明,即使是小的随机扰动也能改变特征重要性,而新的系统性扰动可在不改变标签的情况下导致截然不同的解释。我们将这些结果推广,表明基于范例(如影响函数)的解释同样脆弱。我们对 Hessian 矩阵几何的分析揭示了为何脆弱性可能是当前解释方法的一个根本性挑战。

关键词

引用

@article{arxiv.1710.10547,
  title  = {Interpretation of Neural Networks is Fragile},
  author = {Amirata Ghorbani and Abubakar Abid and James Zou},
  journal= {arXiv preprint arXiv:1710.10547},
  year   = {2018}
}

备注

Published as a conference paper at AAAI 2019