中文

基于神经元敏感度的深度神经网络对抗鲁棒性解释与提升

计算机视觉与模式识别 2020-12-15 v3

摘要

深度神经网络(DNNs)易受对抗样本攻击,即带有难以察觉扰动的图像误导 DNNs 得出错误结果。尽管对抗样本带来潜在风险,它们也有助于揭示 DNNs 的弱点与盲点。因此,对抗设定下 DNN 的可解释性旨在解释其决策过程背后的原理,并促成更深入理解以带来更好的实际应用。为此,我们试图从神经元敏感度的新视角解释深度模型的对抗鲁棒性,该敏感度由神经元在良性与对抗样本下的行为变异强度度量。本文首先建立了对抗鲁棒性与神经元敏感度之间的紧密关联,因为敏感神经元在对抗设定下对模型预测做出了最显著的贡献。基于此,我们进一步提出通过约束良性与对抗样本间敏感神经元的相似性来提升对抗鲁棒性,从而稳定敏感神经元对对抗噪声的行为。此外,我们展示了最先进的对抗训练方法通过降低神经元敏感度来提升模型鲁棒性,这反过来证实了对抗鲁棒性与神经元敏感度之间的强关联,以及利用敏感神经元构建鲁棒模型的有效性。在多个数据集上的大量实验表明,我们的算法有效取得了优异结果。

关键词

引用

@article{arxiv.1909.06978,
  title  = {Interpreting and Improving Adversarial Robustness of Deep Neural Networks with Neuron Sensitivity},
  author = {Chongzhi Zhang and Aishan Liu and Xianglong Liu and Yitao Xu and Hang Yu and Yuqing Ma and Tianlin Li},
  journal= {arXiv preprint arXiv:1909.06978},
  year   = {2020}
}

备注

Accepted by IEEE Transaction on Image Processing