利用对抗样本迈向可解释的深度神经网络
计算机视觉与模式识别
2017-08-21 v1
摘要
深度神经网络(DNN)在众多任务上展现了令人瞩目的性能,但由于其内部结构和学习到的参数不可解释,通常被认为是不透明的。本文中,我们使用由集成优化算法生成的对抗图像,重新审视DNN的内部表征。我们发现:(1)DNN中的神经元并非真正检测语义物体/部件,而是仅作为循环出现的判别性图像块对物体/部件做出响应;(2)深度视觉表征并非视觉概念的鲁棒分布式编码,因为对抗图像的表示与真实图像的表示在很大程度上不一致,尽管它们具有相似的视觉外观。这两点发现均与先前的研究结论不同。为进一步提升DNN的可解释性,我们提出了一种带有一致性损失的对抗训练方案,使神经元被赋予人类可解释的概念。由此诱导出的可解释表征使我们能够将最终结果追溯到有影响力的神经元。因此,人类用户可以了解模型如何做出预测,以及何时和为何出错。
引用
@article{arxiv.1708.05493,
title = {Towards Interpretable Deep Neural Networks by Leveraging Adversarial Examples},
author = {Yinpeng Dong and Hang Su and Jun Zhu and Fan Bao},
journal= {arXiv preprint arXiv:1708.05493},
year = {2017}
}