中文

越狱提示攻击:一种针对扩散模型的可控对抗攻击

密码学与安全 2025-05-27 v4 人工智能

摘要

文本到图像(T2I)模型可能被恶意利用以生成有害内容,如性露骨、不忠实、误导性或不适合工作场所(NSFW)的图像。以往的攻击在很大程度上依赖于扩散模型的可用性,或涉及漫长的优化过程。在本工作中,我们研究了一种更实用且通用的攻击,该攻击不需要目标模型的存在,并证明高维文本嵌入空间本身包含可被利用来生成有害图像的 NSFW 概念。我们提出了越狱提示攻击(JPA)。JPA 首先使用由 ChatGPT 生成的一组反义词在文本嵌入空间中搜索目标恶意概念。随后,在离散词汇空间中优化前缀提示,以在文本嵌入空间中实现恶意概念的语义对齐。我们进一步引入了一种带有梯度掩蔽的软分配技术,使我们能够在离散词汇空间中执行梯度上升。我们在开源 T2I 模型(例如 stable-diffusion-v1-4)和带有黑盒安全检查器的闭源在线服务(例如 DALLE2、Midjourney)上进行了大量实验。结果表明:(1)JPA 绕过了文本和图像安全检查器;(2)同时保持了与目标提示的高度语义对齐。(3)JPA 展示出比以往方法快得多的速度,并且可以完全自动化执行。这些优点使其成为未来文本到图像生成研究中用于鲁棒性评估的宝贵工具。

关键词

引用

@article{arxiv.2404.02928,
  title  = {Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models},
  author = {Jiachen Ma and Yijiang Li and Zhiqing Xiao and Anda Cao and Jie Zhang and Chao Ye and Junbo Zhao},
  journal= {arXiv preprint arXiv:2404.02928},
  year   = {2025}
}