中文

子空间防御:通过学习干净信号子空间丢弃对抗扰动

机器学习 2024-03-26 v1 计算与语言 密码学与安全

摘要

深度神经网络 (DNN) 容易受到对抗攻击是众所周知的,攻击者通过在正常样本上放置精心制作的扰动来欺骗 DNN。为了更好地理解此类攻击,需要对对抗样本所携带的特征进行刻画。在本文中,我们通过谱分析检查样本特征的子空间来应对这一挑战。我们首先实证表明,干净信号或对抗扰动的特征都是冗余的,并分别张成低维线性子空间,且重叠极小,而经典的低维子空间投影可以抑制干净信号子空间之外的扰动特征。这使得 DNN 能够学习一个仅存在干净信号特征而丢弃扰动特征的子空间,从而促进对抗样本的区分。为了防止子空间学习中不可避免的残余扰动,我们提出了一种独立性准则,将干净信号与扰动解耦。实验结果表明,所提策略使模型能够内在地抑制对抗,这不仅提升了模型鲁棒性,还启发了有效对抗防御的新方向。

关键词

引用

@article{arxiv.2403.16176,
  title  = {Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals},
  author = {Rui Zheng and Yuhao Zhou and Zhiheng Xi and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2403.16176},
  year   = {2024}
}

备注

Accepted by COLING 2024