中文

在类激活特征空间中去除对抗噪声

机器学习 2021-04-20 v1

摘要

深度神经网络(DNNs)易受对抗噪声攻击。基于预处理的防御可通过处理输入大幅去除对抗噪声。然而,它们通常受到误差放大效应的影响,尤其在持续演进的攻击面前。为解决该问题,本文提出通过在类激活特征空间中实施自监督对抗训练机制来去除对抗噪声。具体而言,我们首先最大化自然样本类激活特征的扰动以制造对抗样本。然后,我们训练一个去噪模型,以最小化类激活特征空间中对抗样本与自然样本之间的距离。实证评估表明,与先前最先进的方法相比,我们的方法能显著增强对抗鲁棒性,尤其针对未知对抗攻击和自适应攻击。

关键词

引用

@article{arxiv.2104.09197,
  title  = {Removing Adversarial Noise in Class Activation Feature Space},
  author = {Dawei Zhou and Nannan Wang and Chunlei Peng and Xinbo Gao and Xiaoyu Wang and Jun Yu and Tongliang Liu},
  journal= {arXiv preprint arXiv:2104.09197},
  year   = {2021}
}