中文

AdvDiff:利用扩散模型生成无限制对抗样本

机器学习 2024-07-16 v4 计算机视觉与模式识别

摘要

无限制对抗攻击对深度学习模型与对抗防御技术构成严重威胁。它们因能有效绕过防御机制,给深度学习应用带来严重安全问题。然而,以往的攻击方法常将投影梯度下降(PGD)梯度直接注入生成模型的采样中,这在理论上不可证明,因而通过融入对抗目标会生成不真实的样本,尤其对于基于 GAN 的方法在 ImageNet 等大规模数据集上。在本文中,我们提出一种称为 AdvDiff 的新方法,利用扩散模型生成无限制对抗样本。我们设计两种新颖的对抗引导技术,在扩散模型的反向生成过程中进行对抗采样。这两种技术通过可解释地整合目标分类器的梯度,在生成高质量、真实的对抗样本方面有效且稳定。在 MNIST 与 ImageNet 数据集上的实验结果表明,AdvDiff 在生成无限制对抗样本上有效,并且在攻击性能与生成质量上优于 state-of-the-art 无限制对抗攻击方法。

关键词

引用

@article{arxiv.2307.12499,
  title  = {AdvDiff: Generating Unrestricted Adversarial Examples using Diffusion Models},
  author = {Xuelong Dai and Kaisheng Liang and Bin Xiao},
  journal= {arXiv preprint arXiv:2307.12499},
  year   = {2024}
}

备注

ECCV 2024