中文

SD-NAE:利用稳定扩散生成自然对抗样本

计算机视觉与模式识别 2024-05-15 v3

摘要

自然对抗样本(NAEs)是从环境中自然出现的、能够欺骗分类器的图像,对于鲁棒地评估和识别训练模型的脆弱性具有重要作用。本工作中,与以往从真实图像中被动收集NAEs不同,我们提出使用最先进的Stable Diffusion主动合成NAEs。具体而言,我们的方法构建了一个受控的优化过程,其中我们扰动对应于指定类别的token嵌入以生成NAEs。该生成过程由目标分类器的损失梯度引导,确保所创建的图像紧密模仿真实类别却又欺骗分类器。我们的创新方法名为SD-NAE(Stable Diffusion for Natural Adversarial Examples),通过精心设计的实验证明其在生成有效且有用的NAEs方面是有效的。代码见 https://github.com/linyueqian/SD-NAE。

关键词

引用

@article{arxiv.2311.12981,
  title  = {SD-NAE: Generating Natural Adversarial Examples with Stable Diffusion},
  author = {Yueqian Lin and Jingyang Zhang and Yiran Chen and Hai Li},
  journal= {arXiv preprint arXiv:2311.12981},
  year   = {2024}
}

备注

Accepted by ICLR 2024 TinyPapers