深度神经网络的局部解释方法对参数值缺乏敏感性
计算机视觉与模式识别
2018-10-09 v1 机器学习
机器学习
摘要
解释诸如深度神经网络(DNN)等复杂机器学习模型的输出是机器学习中的核心挑战。若干提出的局部解释方法通过识别单个输入的哪些维度对DNN输出贡献最大来解决此问题。本工作的目标是评估局部解释对DNN参数值的敏感性。有些令人惊讶的是,我们发现具有随机初始化权重的DNN产生的解释,在视觉上和定量上都与具有学习到权重的DNN产生的解释相似。我们的猜想是,该现象之所以发生,是因为这些解释由DNN的较低层特征主导,且DNN的架构提供了强先验,显著影响了这些较低层学到的表示。注:本工作现已被我们近期的手稿《显著性图的正确性检验》(将发表于NIPS 2018)所涵盖,其中我们扩展了发现并回应了Sundararajan等人(2018)提出的关切。
引用
@article{arxiv.1810.03307,
title = {Local Explanation Methods for Deep Neural Networks Lack Sensitivity to Parameter Values},
author = {Julius Adebayo and Justin Gilmer and Ian Goodfellow and Been Kim},
journal= {arXiv preprint arXiv:1810.03307},
year = {2018}
}
备注
Workshop Track International Conference on Learning Representations (ICLR)