中文

对抗训练:将对抗扰动嵌入神经网络参数空间以构建鲁棒系统

机器学习 2019-10-11 v1 机器学习

摘要

对抗训练(网络在对抗样本与干净样本上同时进行训练)是最受信赖的抵御对抗攻击的防御方法之一。然而,在实现与部署该方法时有三大主要实际困难——额外的内存与计算成本高昂;干净样本与对抗样本之间的精度权衡;以及对抗扰动缺乏多样性。经典的对抗训练在对抗样本(输入空间)中使用固定的、预先计算的扰动。相比之下,我们将动态对抗扰动引入网络的参数空间,通过对深度卷积神经网络的 fully connected layers(全连接层)添加扰动偏置来实现。在训练中,仅使用干净图像,扰动偏置沿快速梯度符号方向更新,通过复用所计算的梯度信息自动创建并存储对抗扰动。网络对这些学到的对抗扰动进行自动学习与调整。因此,相较于需要对抗样本图像训练集的情况,我们能以可忽略的代价实现对抗训练。此外,若与经典对抗训练结合,我们的扰动偏置可缓解精度权衡困难,并丰富对抗扰动的多样性。

关键词

引用

@article{arxiv.1910.04279,
  title  = {Adversarial Training: embedding adversarial perturbations into the parameter space of a neural network to build a robust system},
  author = {Shixian Wen and Laurent Itti},
  journal= {arXiv preprint arXiv:1910.04279},
  year   = {2019}
}