中文

利用翻转点解释神经网络

机器学习 2019-03-22 v1 机器学习

摘要

神经网络因其缺乏易解释性而受到批评,这削弱了其在重要应用中使用的信心。在此,我们引入一种新技术,通过研究训练好的神经网络的翻转点来解释它。翻转点是位于两个输出类边界上的任意点:例如,对于具有二值 yes/no 输出的神经网络,翻转点是产生相等“yes”和“no”分数的任意输入。最接近给定输入的翻转点尤为重要,且该点是适定优化问题的解。本文概述了翻转点的用途及其计算方法。通过在标准数据集上的结果,我们展示了如何使用翻转点提供对神经网络输出产生的详细解释。此外,对于给定的输入,翻转点使我们能够比 softmax 分数更有效地衡量对输出正确性的信心。它们还能识别输入中有影响力的特征、识别偏差,并找出改变模型输出的输入变化。我们表明,输入与最近翻转点之间的距离可识别训练数据中最具影响力的点。利用主成分分析(PCA)与秩揭示 QR 分解(RR-QR),从每个训练输入到其最近翻转点的方向集合提供了对训练好的神经网络如何处理整个数据集的解释:哪些特征对给定类的分类最重要,哪些特征对特定误分类最负责,攻击者如何欺骗网络等。尽管我们研究的是神经网络的翻转点,其实用性实际上是与模型无关的。

关键词

引用

@article{arxiv.1903.08789,
  title  = {Interpreting Neural Networks Using Flip Points},
  author = {Roozbeh Yousefzadeh and Dianne P. O'Leary},
  journal= {arXiv preprint arXiv:1903.08789},
  year   = {2019}
}