中文

用于防御对抗样本的有益扰动网络

机器学习 2021-09-14 v3 密码学与安全 机器学习

摘要

深度神经网络可能被对抗攻击欺骗:向干净输入添加精心计算的微小对抗扰动会导致最先进的机器学习模型误分类。原因在于神经网络无法适应由对抗扰动引起的输入数据分布漂移。在此,我们提出一种新方案——有益扰动网络(BPN)——通过修正分布漂移来防御对抗攻击。在训练期间,BPN 通过添加新的网络外偏置单元来生成并利用有益扰动(与众所周知的对抗扰动有些相反)。偏置单元影响网络的参数空间,以预先阻止并中和未来输入数据样本上的对抗扰动。为此,BPN 在训练期间以极小代价通过复用已计算出的训练梯度来创建反向对抗攻击。反向攻击被偏置单元捕获,而这些偏置反过来可有效防御未来的对抗样本。反向攻击是一种捷径,即它们影响网络参数而无需实例化可能辅助训练的对抗样本。我们提供了全面的经验证据,表明:1)BPN 对对抗样本具有鲁棒性,且相比经典对抗训练在运行内存和计算效率上更高;2)与仅在干净样本上训练相比,BPN 能以可忽略的额外计算和参数成本防御对抗样本;3)BPN 在干净样本上的准确率损失远小于经典对抗训练;4)BPN 可提升网络的泛化能力;5)仅用快速梯度符号攻击训练的 BPN 可泛化以防御 PGD 攻击。

关键词

引用

@article{arxiv.2009.12724,
  title  = {Beneficial Perturbations Network for Defending Adversarial Examples},
  author = {Shixian Wen and Amanda Rios and Laurent Itti},
  journal= {arXiv preprint arXiv:2009.12724},
  year   = {2021}
}

备注

The paper is under consideration at Pattern Recognition Letters