中文

基于雅可比范数与选择性输入梯度正则化的改进且可解释对抗防御

机器学习 2022-11-15 v4 人工智能 密码学与安全

摘要

深度神经网络(DNNs)已知易受带有难以察觉扰动的对抗样本攻击,即输入图像的微小改变即可引发误分类,从而威胁基于深度学习的部署系统的可靠性。对抗训练(AT)常通过混合 corrupted 与干净数据训练来提升鲁棒性。然而,大多数基于 AT 的方法难以应对为欺骗多种防御模型而生成的迁移对抗样本,因此无法满足真实场景中的泛化需求。此外,对抗训练防御模型通常无法对带扰动输入给出可解释预测,而不同领域专家需要高可解释鲁棒模型以理解 DNN 的行为。本文提出一种基于雅可比范数与选择性输入梯度正则化(J-SIGR)的新方法,通过雅可比归一化给出线性化鲁棒性,并正则化基于扰动的显著图以模仿模型的可解释预测。由此,我们同时实现了 DNN 的改进防御与高可解释性。最后,我们在不同架构上针对强对抗攻击评估了该方法。实验表明,所提 J-SIGR 对迁移对抗攻击具有更优鲁棒性,且神经网络预测易于解释。

关键词

引用

@article{arxiv.2207.13036,
  title  = {Jacobian Norm with Selective Input Gradient Regularization for Improved and Interpretable Adversarial Defense},
  author = {Deyin Liu and Lin Wu and Haifeng Zhao and Farid Boussaid and Mohammed Bennamoun and Xianghua Xie},
  journal= {arXiv preprint arXiv:2207.13036},
  year   = {2022}
}

备注

Under review