网络可解释性与对抗鲁棒性关系的实证研究
机器学习
2020-12-07 v6 机器学习
摘要
深度神经网络(DNNs)已取得诸多成功,但存在两大主要问题:(1)易受对抗样本攻击,以及(2)难以被人类解释。有趣的是,近期经验与理论证据表明这两类看似无关的问题实则相关。特别地,鲁棒模型往往比非鲁棒模型提供更可解释的梯度。然而,该关系是否反向成立仍不清楚。本文中,我们寻求以下问题的经验答案:当模型被训练为具有可解释梯度时,能否获得对抗鲁棒性?我们引入一种受理论启发的技术,称为解释正则化(Interpretation Regularization, IR),它鼓励模型梯度(1)匹配可解释目标显著图的方向,且(2)具有较小幅值。为评估模型性能并梳理有助于对抗鲁棒性的因素,我们在 MNIST 与 CIFAR-10 上针对与攻击进行了大量实验。我们证明训练网络具有可解释梯度可提升其对抗扰动的鲁棒性。应用网络解释技术 SmoothGrad 带来额外性能增益,尤其在跨范数攻击与强扰动下。结果表明模型梯度的可解释性是对抗鲁棒性的关键因素。实验代码见 https://github.com/a1noack/interp_regularization。
引用
@article{arxiv.1912.03430,
title = {An Empirical Study on the Relation between Network Interpretability and Adversarial Robustness},
author = {Adam Noack and Isaac Ahern and Dejing Dou and Boyang Li},
journal= {arXiv preprint arXiv:1912.03430},
year = {2020}
}
备注
Accepted by the journal Springer Nature Computer Science