中文

AdvI2I:针对图像到图像扩散模型的对抗图像攻击

计算机视觉与模式识别 2025-09-15 v3 人工智能

摘要

近期扩散模型的进展显著提升了图像合成质量,但也带来了严重的安全隐患,尤其是生成不适合工作场所(Not Safe for Work, NSFW)内容。先前的研究表明,对抗性提示词可用于生成 NSFW 内容。然而,这类对抗性文本提示词常被基于文本的过滤器轻易检测到,限制了其有效性。本文暴露了一个被忽视的漏洞:针对图像到图像( Image-to-Image, I2I)扩散模型的对抗图像攻击。我们提出了 AdvI2I—a 一个新框架,通过操控输入图像诱导扩散模型生成 NSFW 内容。通过优化生成器来制造对抗图像,AdvI2I 能规避现有的防御措施,如Safe Latent Diffusion (SLD),而无需更改文本提示词。此外,我们引入 AdvI2I-Adaptive—an 一个改进版本,能够适应潜在的防御措施,并最小化对抗图像与 NSFW 概念嵌入之间的相似度,使攻击更具抗性。通过大量实验,我们展示了 AdvI2I 和 AdvI2I-Adaptive 能有效绕过当前安全措施,凸显了迫切需要加强安全措施以应对滥用 I2I 扩散模型的紧迫性。

关键词

引用

@article{arxiv.2410.21471,
  title  = {AdvI2I: Adversarial Image Attack on Image-to-Image Diffusion models},
  author = {Yaopei Zeng and Yuanpu Cao and Bochuan Cao and Yurui Chang and Jinghui Chen and Lu Lin},
  journal= {arXiv preprint arXiv:2410.21471},
  year   = {2025}
}