面向对抗净化的去噪自编码器方法
机器学习
2022-08-31 v1 密码学与安全
摘要
随着深度学习模型在图像识别中的快速发展和广泛应用,安全性成为其在安全关键系统中部署的主要关切。由于深度学习模型的准确性与鲁棒性主要源于训练样本的纯净度,因此深度学习架构常易受对抗攻击。对抗攻击通常通过向正常图像施加细微扰动获得,这些扰动大多为人眼难以察觉,却可严重混淆最先进的机器学习模型。我们提出一个名为 APuDAE 的框架,利用去噪自编码器(Denoising AutoEncoders, DAEs)以自适应方式净化这些样本,从而提升受攻击目标分类网络的分类准确率。我们还展示了自适应使用 DAEs 而非直接使用的进一步准确率提升,以及对设计用以欺骗它们的自适应攻击可能性的更强鲁棒性。我们在 MNIST、CIFAR-10、ImageNet 数据集上展示了结果,并表明我们的框架(APuDAE)在净化对抗样本方面提供了与基线方法相当且在多数情况下更优的性能。我们还专门设计了用于攻击我们净化模型的自适应攻击,并展示了我们的防御对此的鲁棒性。
引用
@article{arxiv.2208.13838,
title = {Towards Adversarial Purification using Denoising AutoEncoders},
author = {Dvij Kalaria and Aritra Hazra and Partha Pratim Chakrabarti},
journal= {arXiv preprint arXiv:2208.13838},
year = {2022}
}
备注
Submitted to AAAI 2023