中文

对抗鲁棒性与显著图可解释性之间的联系

机器学习 2019-05-13 v1 计算机视觉与模式识别 机器学习

摘要

近期关于神经网络对抗脆弱性的研究表明,相比非鲁棒模型,训练得对对抗攻击更具鲁棒性的模型展现出更具可解释性的显著图。我们旨在通过考量输入图像与显著图之间的一致性来量化这一行为。我们假设,随着到决策边界的距离增大,这种一致性也随之增大。在线性模型情形下,该联系严格成立。我们通过基于局部Lipschitz正则化训练的模型实验证实了这些理论发现,并指出了神经网络的非线性本质在何处削弱了这种关系。

关键词

引用

@article{arxiv.1905.04172,
  title  = {On the Connection Between Adversarial Robustness and Saliency Map Interpretability},
  author = {Christian Etmann and Sebastian Lunz and Peter Maass and Carola-Bibiane Schönlieb},
  journal= {arXiv preprint arXiv:1905.04172},
  year   = {2019}
}

备注

12 pages, accepted for publication at the 36th International Conference on Machine Learning 2019