利用对抗样本迈向可解释的深层神经网络
机器学习
2019-01-29 v1 机器学习
摘要
有时 DNN 仅产生一个结果是不够的。例如在医疗等应用中,用户需要理解决策的依据。因此,亟需开发算法以学习具有良好可解释性的模型(Doshi-Velez 2017)。导致 DNN 缺乏可解释性的一个重要因素是神经元的不确定性,即一个神经元可能针对各种不相关的概念放电。本工作旨在通过降低神经元的不确定性来提升 DNN 在整个图像空间上的可解释性。本文贡献如下:1) 提出一种度量网络中神经元一致性强度的指标。2) 利用对抗样本发现神经元所学特征具有不确定性。3) 提出通过对抗训练算法与一致性损失来提升神经元在对抗样本子集上的一致性。
引用
@article{arxiv.1901.09035,
title = {Towards Interpretable Deep Neural Networks by Leveraging Adversarial Examples},
author = {Yinpeng Dong and Fan Bao and Hang Su and Jun Zhu},
journal= {arXiv preprint arXiv:1901.09035},
year = {2019}
}
备注
In AAAI-19 Workshop on Network Interpretability for Deep Learning