用于训练抗对抗攻击自编码器的双反向传播
计算机视觉与模式识别
2020-03-05 v1 机器学习
摘要
众所周知,深度学习易受对抗样本攻击。本文关注自编码器的对抗攻击。自编码器(AEs)的安全性十分重要,因为它们被广泛用作数据存储与传输的压缩方案,然而当前自编码器易遭攻击,即轻微修改输入却得到完全不同的编码。该脆弱性根源于自编码器的敏感性,为增强鲁棒性,我们提出采用双反向传播(DBP)来保护如 VAE 和 DRAW 等自编码器。我们限制从重建图像到原始图像的梯度,使自编码器对对抗攻击产生的微小扰动不敏感。在通过 DBP 平滑梯度后,我们进一步用高斯混合模型(GMM)平滑标签,以实现准确且鲁棒的分类。我们在 MNIST、CelebA、SVHN 上证明,我们的方法可得到抗攻击的鲁棒自编码器,以及与 GMM 结合时可用于图像转换且免疫对抗攻击的鲁棒分类器。
引用
@article{arxiv.2003.01895,
title = {Double Backpropagation for Training Autoencoders against Adversarial Attack},
author = {Chengjin Sun and Sizhe Chen and Xiaolin Huang},
journal= {arXiv preprint arXiv:2003.01895},
year = {2020}
}