用于理解图像分类决策与提升神经网络鲁棒性的对抗性解释
机器学习
2019-11-06 v2 密码学与安全
机器学习
摘要
对于医学影像或欺诈检测等敏感问题,由于对其可靠性的担忧,神经网络(NN)的采用一直较为缓慢,这催生了多种解释其决策的算法。NN 还被发现易受到一类称为对抗样本的不易察觉的攻击,这些攻击会任意改变网络的输出。在此我们证明,此类攻击既能使先前解释 NN 决策的尝试失效,又能在网络非常鲁棒时,将攻击本身用作对模型保真度更高的解释。我们展示了一种受 Lipschitz 约束启发的新型正则化技术与其他所提改进相结合,可大幅提升 NN 对对抗样本的抵抗能力。在 ImageNet 分类任务上,我们展示了准确率为鲁棒性面积(ARA)0.0053 的网络,其 ARA 是此前最优水平的 2.4 倍。改进理解 NN 决策的机制,对于在敏感领域建立信任以及更多了解 NN 所响应的刺激而言,是一个重要方向。
引用
@article{arxiv.1906.02896,
title = {Adversarial Explanations for Understanding Image Classification Decisions and Improved Neural Network Robustness},
author = {Walt Woods and Jack Chen and Christof Teuscher},
journal= {arXiv preprint arXiv:1906.02896},
year = {2019}
}
备注
23 pages with a 14 page appendix. Submitted to Nature ML for peer review