对抗防御的困境?尝试扩散模型
计算机视觉与模式识别
2024-05-21 v3 密码学与安全
摘要
对抗攻击通过引入细微扰动诱发误分类。近期,扩散模型被应用于图像分类器,通过对抗训练或净化对抗噪声来提升对抗鲁棒性。然而,基于扩散模型的对抗训练常面临收敛挑战与高昂的计算开销。此外,基于扩散模型的净化不可避免地导致数据偏移,且被认为易受更强的自适应攻击影响。为解决这些问题,我们提出了真值最大化扩散分类器(Truth Maximization Diffusion Classifier, TMDC),这是一种基于预训练扩散模型与贝叶斯定理的生成式贝叶斯分类器。与数据驱动分类器不同,TMDC 在贝叶斯原理的指导下,利用扩散模型的条件似然来确定输入图像的类别概率,从而免受数据偏移和对抗训练局限性的影响。此外,为增强 TMDC 抵抗更强对抗攻击的韧性,我们提出了一种针对扩散分类器的优化策略。该策略以真实标签为条件,在受扰动数据集上对扩散模型进行后训练,引导扩散模型学习数据分布并最大化真实标签下的似然。所提出的方法在 CIFAR10 数据集上抵御重度白盒攻击和强自适应攻击时达到了 SOTA 性能。具体而言,在 时,TMDC 抵抗 范数有界扰动和 范数有界扰动的鲁棒准确率分别达到 82.81% 和 86.05%。
引用
@article{arxiv.2404.08273,
title = {Struggle with Adversarial Defense? Try Diffusion},
author = {Yujie Li and Yanbin Wang and Haitao Xu and Bin Liu and Jianguo Sun and Zhenhao Guo and Wenrui Ma},
journal= {arXiv preprint arXiv:2404.08273},
year = {2024}
}