多方向初始化扰动以实现快速对抗训练
机器学习
2021-01-26 v2 机器学习
摘要
深度学习领域近期的研究表明深度神经网络(DNNs)易受对抗样本的攻击。具体而言,在图像分类中,对抗样本可通过在干净图像上添加几乎难以察觉的扰动来欺骗训练良好的深度神经网络。对抗训练是最直接有效的方法之一,它通过最小化扰动数据的损失来学习抵御对抗攻击的鲁棒深度网络。已有证明表明,使用快速梯度符号法(FGSM)可实现快速对抗训练。然而,基于FGSM的对抗训练可能因对FGSM样本过拟合而最终得到失效的模型。本文提出多样化初始化扰动对抗训练(DIP-FAT),其通过随机方向上扩大目标模型的输出距离来寻求扰动的初始化。由于随机方向的多样性,采用FGSM的嵌入式快速对抗训练增加了来自对抗方的信息并降低了过拟合的可能性。除防止过拟合外,大量结果表明我们提出的DIP-FAT技术还能提升干净数据的准确率。DIP-FAT方法的最大优势在于:在干净数据、扰动数据与效率之间实现了最佳平衡。
引用
@article{arxiv.2005.07606,
title = {Initializing Perturbations in Multiple Directions for Fast Adversarial Training},
author = {Xunguang Wang and Ship Peng Xu and Eric Ke Wang},
journal= {arXiv preprint arXiv:2005.07606},
year = {2021}
}
备注
has no contribution