用于对抗净化的扩散模型
机器学习
2022-05-17 v1 密码学与安全
计算机视觉与模式识别
摘要
对抗净化指一类利用生成模型去除对抗扰动的保护方法。这些方法不对攻击形式和分类模型作假设,因而可保护已有分类器免受未知威胁。然而,其当前性能落后于对抗训练方法。本文提出DiffPure,使用扩散模型进行对抗净化:给定对抗样本,我们首先按前向扩散过程加入少量噪声对其进行扩散,然后通过反向生成过程恢复干净图像。为以高效且可扩展的方式针对强自适应攻击评估我们的方法,我们提出使用伴随方法计算反向生成过程的全梯度。在包含CIFAR-10、ImageNet和CelebA-HQ的三个图像数据集以及包含ResNet、WideResNet和ViT的三种分类器架构上的大量实验表明,我们的方法取得了最先进的结果,常大幅优于当前的对抗训练与对抗净化方法。项目页面:https://diffpure.github.io。
引用
@article{arxiv.2205.07460,
title = {Diffusion Models for Adversarial Purification},
author = {Weili Nie and Brandon Guo and Yujia Huang and Chaowei Xiao and Arash Vahdat and Anima Anandkumar},
journal= {arXiv preprint arXiv:2205.07460},
year = {2022}
}
备注
ICML 2022