ScoreAdv:基于扩散模型的自然对抗样本得分导向生成
计算机视觉与模式识别
2025-10-31 v2
摘要
尽管深度学习在多个领域取得成功,但仍面临对抗攻击的脆弱性。虽然许多现有对抗攻击方法实现了高成功率,但通常依赖于$p范数扰动约束,与人类感知能力不符。因此,研究者们转向生成自然的无限制对抗样本(UAEs)。GAN-based方法存在固有局限,如图像质量差和模式坍缩。而扩散模型已用于UAE生成,但仍依赖于迭代PGD扰动注入,未充分利用其核心去噪能力。本文提出一种基于扩散模型的UAE生成方法,命名为ScoreAdv。该方法引入可解释的对抗引导机制,逐步将采样分布偏移至对抗分布;同时利用可解释的显著性图将参考图像的视觉信息注入生成样本。值得注意的是,ScoreAdv能够生成任意数量的自然对抗样本,可攻击不仅是分类模型,还能攻击检索模型。我们在ImageNet和CelebA数据集上进行大量实验,验证了ScoreAdv在十个目标模型上的性能,适用于黑箱和白箱设置。结果表明,ScoreAdv在攻击成功率和图像质量方面达到最先进水平,同时保持推理效率。此外,去噪与对抗扰动之间的动态平衡使ScoreAdv即使在防御措施下仍具鲁棒性。
引用
@article{arxiv.2507.06078,
title = {ScoreAdv: Score-based Targeted Generation of Natural Adversarial Examples via Diffusion Models},
author = {Chihan Huang and Hao Tang},
journal= {arXiv preprint arXiv:2507.06078},
year = {2025}
}