AutoGAN:针对对抗攻击的鲁棒分类器
机器学习
2018-12-11 v1 密码学与安全
计算机视觉与模式识别
机器学习
摘要
分类器无法正确分类那些被有意且难以察觉地扰动以导致误分类的输入图像。这种脆弱性已被证明在各类分类器中普遍存在,无论其类型、架构或参数如何。针对对抗攻击的常规防御方法通过以各种方式生成的额外对抗样本进行训练来修改分类器边界。在本文中,我们提出 AutoGAN,它通过增强由训练数据定义的低维流形并将扰动数据点投影到该流形上来抵御对抗攻击。AutoGAN 减轻了对知晓攻击类型与强度以及拥有该攻击的对抗样本的需求。我们的方法使用了一个生成对抗网络(GAN),其生成器为自编码器,判别器同时用作分类器。我们使用最先进的快速梯度符号方法(FGSM)生成的对抗样本以及随机高斯噪声生成的样本(均使用 MNIST 数据集)对 AutoGAN 进行测试。对于训练与测试中不同强度的扰动,AutoGAN 在 FGSM 扰动的样本上可将 FGSM 方法的准确率最高超越 25 个百分点。在没有增广训练数据集的情况下,AutoGAN 在 FGSM 测试对抗样本上达到了 89% 的准确率,而 FGSM 方法仅为 1%。
引用
@article{arxiv.1812.03405,
title = {AutoGAN: Robust Classifier Against Adversarial Attacks},
author = {Blerta Lindqvist and Shridatt Sugrim and Rauf Izmailov},
journal= {arXiv preprint arXiv:1812.03405},
year = {2018}
}