SemDiff:通过语义属性优化在扩散模型中生成自然的无限制对抗样本
机器学习
2025-04-17 v1 计算机视觉与模式识别
摘要
无限制对抗样本 (UAEs) 允许攻击者在无需给定干净样本的情况下创建非受限对抗样本,对深度学习模型的安全构成严重威胁。近期研究利用扩散模型生成 UAEs,但这些 UAEs 常因仅在中间潜在噪声中进行优化而缺乏自然性和不可感知性。鉴于此,我们提出 SemDiff,一种新型无限制对抗攻击,通过在扩散模型的语义潜在空间中探索有意义的属性,构建多属性优化方法,以确保攻击成功的同时维持生成 UAEs 的自然性和不可感知性。我们在三个高分辨率数据集上对四项任务进行了广泛实验,包括 CelebA-HQ、AFHQ 和 ImageNet。结果表明,SemDiff 在攻击成功率和不可感知性方面均优于最先进的方法。生成的 UAEs 自然且呈现语义上有意义的变化,符合属性权重的预期。此外,SemDiff 被发现能够规避不同防御措施,这进一步验证了其有效性和威胁性。
引用
@article{arxiv.2504.11923,
title = {SemDiff: Generating Natural Unrestricted Adversarial Examples via Semantic Attributes Optimization in Diffusion Models},
author = {Zeyu Dai and Shengcai Liu and Rui He and Jiahao Wu and Ning Lu and Wenqi Fan and Qing Li and Ke Tang},
journal= {arXiv preprint arXiv:2504.11923},
year = {2025}
}