中文

用于对抗净化的对抗引导扩散模型

计算机视觉与模式识别 2025-03-12 v5 人工智能

摘要

基于扩散模型(DM)的对抗净化(AP)已被证明是一种强大的防御方法,能够去除对抗扰动并生成无威胁的净化样本。原则上,预训练的 DM 只能确保净化样本符合训练数据的相同分布,但这可能会无意中损害输入样本的语义信息,导致净化样本被误分类。最近的进展引入了引导扩散技术,以在去除扰动的同时保留语义信息。然而,这些引导通常依赖于净化样本与扩散样本之间的距离度量,这也会在净化样本中保留扰动。为了进一步释放基于 DM 的 AP 的鲁棒性潜力,我们提出了一种对抗引导扩散模型(AGDM),通过引入一种包含充分语义信息但不显式涉及对抗扰动的新型对抗引导。该引导由通过对抗训练获得的辅助神经网络建模,考虑的是潜在表示中的距离而非像素级的值。在 CIFAR-10、CIFAR-100 和 ImageNet 上进行了大量实验,证明我们的方法能够有效同时保持语义信息并去除对抗扰动。此外,综合比较表明,我们的方法显著增强了现有基于 DM 的 AP 的鲁棒性,在 CIFAR-10 上平均鲁棒准确率最高提升了 7.30%。

关键词

引用

@article{arxiv.2403.16067,
  title  = {Adversarial Guided Diffusion Models for Adversarial Purification},
  author = {Guang Lin and Zerui Tao and Jianhai Zhang and Toshihisa Tanaka and Qibin Zhao},
  journal= {arXiv preprint arXiv:2403.16067},
  year   = {2025}
}