中文

通过正则化输入梯度提升深度神经网络的对抗鲁棒性与可解释性

机器学习 2017-11-28 v1 密码学与安全 计算机视觉与模式识别

摘要

深度神经网络已被证明在解决许多分类问题时异常有效,但近来因其两大主要缺陷而受到批评:其预测背后的原因不可解释,且预测本身常被微小的对抗扰动所欺骗。这些问题对神经网络在需要安全性或透明度的领域的采用构成了主要障碍。在这项工作中,我们评估了以可微方式惩罚输入微小变化改变模型预测程度的一类防御方法的有效性。在多种攻击、架构、防御和数据集上,我们发现,采用这种输入梯度正则化训练的神经网络对为欺骗所有其他模型而生成的迁移对抗样本表现出鲁棒性。我们还发现,为欺骗梯度正则化模型而生成的对抗样本同样能很好地欺骗所有其他模型,并且实际上导致了被人们评为更“合理”、可解释的误分类(我们在一项人类受试者实验中对此进行了确认)。最后,我们证明正则化输入梯度使其作为模型预测依据的理性说明在自然上更具可解释性。我们以讨论深度神经网络中可解释性与鲁棒性之间的这种关系作为结语。

关键词

引用

@article{arxiv.1711.09404,
  title  = {Improving the Adversarial Robustness and Interpretability of Deep Neural Networks by Regularizing their Input Gradients},
  author = {Andrew Slavin Ross and Finale Doshi-Velez},
  journal= {arXiv preprint arXiv:1711.09404},
  year   = {2017}
}

备注

To appear in AAAI 2018