中文

用于理解图像分类决策与提升神经网络鲁棒性的对抗性解释

机器学习 2019-11-06 v2 密码学与安全 机器学习

摘要

对于医学影像或欺诈检测等敏感问题,由于对其可靠性的担忧,神经网络(NN)的采用一直较为缓慢,这催生了多种解释其决策的算法。NN 还被发现易受到一类称为对抗样本的不易察觉的攻击,这些攻击会任意改变网络的输出。在此我们证明,此类攻击既能使先前解释 NN 决策的尝试失效,又能在网络非常鲁棒时,将攻击本身用作对模型保真度更高的解释。我们展示了一种受 Lipschitz 约束启发的新型正则化技术与其他所提改进相结合,可大幅提升 NN 对对抗样本的抵抗能力。在 ImageNet 分类任务上,我们展示了准确率为鲁棒性面积(ARA)0.0053 的网络,其 ARA 是此前最优水平的 2.4 倍。改进理解 NN 决策的机制,对于在敏感领域建立信任以及更多了解 NN 所响应的刺激而言,是一个重要方向。

关键词

引用

@article{arxiv.1906.02896,
  title  = {Adversarial Explanations for Understanding Image Classification Decisions and Improved Neural Network Robustness},
  author = {Walt Woods and Jack Chen and Christof Teuscher},
  journal= {arXiv preprint arXiv:1906.02896},
  year   = {2019}
}

备注

23 pages with a 14 page appendix. Submitted to Nature ML for peer review