子空间防御:通过学习干净信号子空间丢弃对抗扰动
机器学习
2024-03-26 v1 计算与语言
密码学与安全
摘要
深度神经网络 (DNN) 容易受到对抗攻击是众所周知的,攻击者通过在正常样本上放置精心制作的扰动来欺骗 DNN。为了更好地理解此类攻击,需要对对抗样本所携带的特征进行刻画。在本文中,我们通过谱分析检查样本特征的子空间来应对这一挑战。我们首先实证表明,干净信号或对抗扰动的特征都是冗余的,并分别张成低维线性子空间,且重叠极小,而经典的低维子空间投影可以抑制干净信号子空间之外的扰动特征。这使得 DNN 能够学习一个仅存在干净信号特征而丢弃扰动特征的子空间,从而促进对抗样本的区分。为了防止子空间学习中不可避免的残余扰动,我们提出了一种独立性准则,将干净信号与扰动解耦。实验结果表明,所提策略使模型能够内在地抑制对抗,这不仅提升了模型鲁棒性,还启发了有效对抗防御的新方向。
引用
@article{arxiv.2403.16176,
title = {Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals},
author = {Rui Zheng and Yuhao Zhou and Zhiheng Xi and Tao Gui and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2403.16176},
year = {2024}
}
备注
Accepted by COLING 2024