中文

文本到图像生成式AI系统的自动越狱攻击

人工智能 2024-05-29 v2 密码学与安全

摘要

近期的人工智能系统在信息检索、语言生成和基于大语言模型(LLMs)的图像生成等各项任务上展现出极其强大的性能,甚至超越了人类表现。与此同时,存在多种安全风险,可能通过绕过LLMs中的对齐机制来生成恶意内容,这通常被称为越狱攻击。然而,以往的大多数工作仅关注LLMs中基于文本的越狱攻击,而文本到图像(T2I)生成系统的越狱攻击相对被忽视。本文首先评估了商业T2I生成系统(如ChatGPT、Copilot和Gemini)在使用朴素提示词进行版权侵权方面的安全性。通过这项实证研究,我们发现Copilot和Gemini分别仅阻止了12%和17%的朴素提示词攻击,而ChatGPT阻止了84%的攻击。随后,我们进一步提出了一种针对T2I生成系统的更强自动化越狱流水线,该流水线能生成绕过其安全防护的提示词。我们的自动化越狱框架利用LLM优化器生成提示词,以最大化生成图像的违规程度,无需任何权重更新或梯度计算。令人惊讶的是,我们简单而有效的方法成功越狱了ChatGPT,使其阻止率仅为11.0%,并在76%的情况下生成了受版权保护的内容。最后,我们探索了多种防御策略,例如生成后过滤和机器遗忘技术,但发现它们效果不足,这表明需要更强的防御机制。

关键词

引用

@article{arxiv.2405.16567,
  title  = {Automatic Jailbreaking of the Text-to-Image Generative AI Systems},
  author = {Minseon Kim and Hyomin Lee and Boqing Gong and Huishuai Zhang and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2405.16567},
  year   = {2024}
}

备注

Under review