中文

SurrogatePrompt:通过替换绕过文生图模型的安全过滤器

计算机视觉与模式识别 2024-10-18 v3 密码学与安全

摘要

DALL\cdotE 2 和 Midjourney 等先进的文生图模型具备生成高度逼真图像的能力,这引发了关于不安全内容(包括成人、暴力或政治人物的欺骗性图像)潜在扩散的显著担忧。尽管这些模型声称实施了严格的安全机制以限制生成不适合工作场所(NSFW)的内容,我们成功设计并展示了针对 Midjourney 的首批提示攻击,从而生成了大量照片级逼真的 NSFW 图像。我们揭示了此类提示攻击的基本原理,并建议策略性地替换可疑提示中的高风险部分以规避闭源安全措施。我们的新框架 SurrogatePrompt 利用大语言模型、图像到文本和图像到图像模块,系统性地生成攻击提示,以实现大规模自动化攻击提示创建。评估结果表明,我们的攻击提示绕过 Midjourney 专有安全过滤器的成功率达 88%,并生成了描绘政治人物处于暴力场景中的伪造图像。主观与客观评估均证实,由我们的攻击提示生成的图像带来了相当大的安全危害。

关键词

引用

@article{arxiv.2309.14122,
  title  = {SurrogatePrompt: Bypassing the Safety Filter of Text-to-Image Models via Substitution},
  author = {Zhongjie Ba and Jieming Zhong and Jiachen Lei and Peng Cheng and Qinglong Wang and Zhan Qin and Zhibo Wang and Kui Ren},
  journal= {arXiv preprint arXiv:2309.14122},
  year   = {2024}
}

备注

To appear in the the 31st ACM Conference on Computer and Communications Security (CCS)