中文

SneakyPrompt:越狱文本到图像生成模型

机器学习 2023-11-14 v3

摘要

Stable Diffusion 与 DALL\cdotE 等文本到图像生成模型因生成不安全内容(NSFW)等有害图像引发诸多伦理担忧。为应对这些伦理担忧,常采用安全过滤器以防止 NSFW 图像生成。本工作中,我们提出 SneakyPrompt,首个自动化攻击框架,用于越狱文本到图像生成模型,使其即便采用安全过滤器也生成 NSFW 图像。给定被安全过滤器拦截的提示,SneakyPrompt 反复查询文本到图像生成模型,并基于查询结果策略性扰动提示中的词元以绕过安全过滤器。具体而言,SneakyPrompt 利用强化学习引导词元扰动。我们的评估表明 SneakyPrompt 成功越狱带闭盒安全过滤器的 DALL\cdotE 2 以生成 NSFW 图像。此外,我们还在 Stable Diffusion 模型上部署若干最先进的开源安全过滤器。评估显示 SneakyPrompt 不仅成功生成 NSFW 图像,且在扩展至越狱文本到图像生成模型时,在查询数与所生成 NSFW 图像质量两方面均优于现有文本对抗攻击。SneakyPrompt 为开源项目,可见于该仓库:\url{https://github.com/Yuchen413/text2image_safety}。

关键词

引用

@article{arxiv.2305.12082,
  title  = {SneakyPrompt: Jailbreaking Text-to-image Generative Models},
  author = {Yuchen Yang and Bo Hui and Haolin Yuan and Neil Gong and Yinzhi Cao},
  journal= {arXiv preprint arXiv:2305.12082},
  year   = {2023}
}

备注

To appear in the Proceedings of the IEEE Symposium on Security and Privacy (Oakland), 2024