对抗鲁棒性与显著图可解释性之间的联系
机器学习
2019-05-13 v1 计算机视觉与模式识别
机器学习
摘要
近期关于神经网络对抗脆弱性的研究表明,相比非鲁棒模型,训练得对对抗攻击更具鲁棒性的模型展现出更具可解释性的显著图。我们旨在通过考量输入图像与显著图之间的一致性来量化这一行为。我们假设,随着到决策边界的距离增大,这种一致性也随之增大。在线性模型情形下,该联系严格成立。我们通过基于局部Lipschitz正则化训练的模型实验证实了这些理论发现,并指出了神经网络的非线性本质在何处削弱了这种关系。
引用
@article{arxiv.1905.04172,
title = {On the Connection Between Adversarial Robustness and Saliency Map Interpretability},
author = {Christian Etmann and Sebastian Lunz and Peter Maass and Carola-Bibiane Schönlieb},
journal= {arXiv preprint arXiv:1905.04172},
year = {2019}
}
备注
12 pages, accepted for publication at the 36th International Conference on Machine Learning 2019