通过优化特征表示削弱对抗扰动的影响
计算机视觉与模式识别
2019-10-02 v2 机器学习
摘要
深度神经网络对对抗样本高度脆弱,这给这些最先进的模型带来了严重的安全问题。已有许多防御方法被提出以缓解此问题。然而,其中大量方法依赖于对目标模型的修改或额外训练。在本工作中,我们分析研究了非扰动图像与扰动图像在各层上的表示,并展示了扰动对这些表示的影响。据此,提出了一种基于白化着色变换的方法,以削弱由对抗者引起的任意目标层的错误表示。我们的方法可应用于任意模型的任意层,无需任何修改或额外训练。由于该层表示的完全白化不易微分,我们所提方法对白盒攻击具有极强的鲁棒性。此外,我们展示了我们的方法针对一些最先进的黑盒攻击的有效性。
引用
@article{arxiv.1907.01023,
title = {Diminishing the Effect of Adversarial Perturbations via Refining Feature Representation},
author = {Nader Asadi and AmirMohammad Sarfi and Mehrdad Hosseinzadeh and Sahba Tahsini and Mahdi Eftekhari},
journal= {arXiv preprint arXiv:1907.01023},
year = {2019}
}
备注
Accepted at NeuralIPS 2019 workshop on Safety and Robustness in Decision Making