用于对抗净化的引导扩散模型
计算机视觉与模式识别
2022-06-30 v3 人工智能
摘要
随着深度神经网络(DNNs)在各种算法和框架中更广泛的应用,安全威胁已成为关注点之一。对抗攻击会干扰基于 DNN 的图像分类器,其中攻击者可以在输入图像上故意添加难以察觉的对抗扰动以欺骗分类器。本文中,我们提出一种新颖的净化方法,称为用于净化的引导扩散模型(GDMP),以帮助保护分类器免受对抗攻击。我们方法的核心是将净化嵌入到去噪扩散概率模型(DDPM)的扩散去噪过程中,使其扩散过程能通过逐渐添加的高斯噪声淹没对抗扰动,并且这些噪声都可以遵循引导去噪过程同时被去除。在我们跨多个数据集的综合实验中,所提出的 GDMP 被证明能将对抗攻击引起的扰动降低到较浅的范围,从而显著提高分类的正确性。GDMP 在 PGD 攻击下将鲁棒准确率提高了 5%,在 CIFAR10 数据集上达到 90.1%。此外,GDMP 在具有挑战性的 ImageNet 数据集上实现了 70.94% 的鲁棒性。
引用
@article{arxiv.2205.14969,
title = {Guided Diffusion Model for Adversarial Purification},
author = {Jinyi Wang and Zhaoyang Lyu and Dahua Lin and Bo Dai and Hongfei Fu},
journal= {arXiv preprint arXiv:2205.14969},
year = {2022}
}