中文

基于逐步编辑的图像生成模型链式越狱攻击

计算与语言 2025-06-04 v2 人工智能 密码学与安全 计算机视觉与模式识别 多媒体

摘要

文本基图像生成模型,如 Stable Diffusion 和 DALL-E 3,在内容创建与出版工作流程中展现出巨大的潜力,成为近年来关注的焦点。尽管这些模型能够生成多样且生动的图像,但为防止生成有害内容(如虐待、暴力或色情材料),正有大量努力在进行防御。为评估现有模型的安全性,我们引入一种新型的越狱方法,称为链式越狱攻击(Chain-of-Jailbreak, CoJ),其通过逐步编辑过程来攻击图像生成模型。具体而言,对于无法通过单一提示绕过安全措施的恶意查询,我们有意将查询分解为多个子查询。然后,图像生成模型被提示生成并基于这些子查询进行迭代编辑图像。为评估 CoJ 攻击方法的有效性,我们构建了包含九种安全情景、三种编辑操作类型以及三种编辑要素的全面数据集 CoJ-Bench。在 GPT-4V、GPT-4o、Gemini 1.5 和 Gemini 1.5 Pro 四个广泛使用的图像生成服务上进行实验,表明我们的 CoJ 攻击方法可成功绕过模型安全防护超过 60%的情况,这显著优于其他越狱方法(仅为 14%)。此外,为增强这些模型对 CoJ 攻击的防御能力,我们还提出了一种有效的基于提示的防御方法——思考 twice 提示(Think Twice Prompting),可成功防御超过 95% 的 CoJ 攻击。我们发布数据集和代码,以促进 AI 安全研究。

关键词

引用

@article{arxiv.2410.03869,
  title  = {Chain-of-Jailbreak Attack for Image Generation Models via Editing Step by Step},
  author = {Wenxuan Wang and Kuiyi Gao and Youliang Yuan and Jen-tse Huang and Qiuzhi Liu and Shuai Wang and Wenxiang Jiao and Zhaopeng Tu},
  journal= {arXiv preprint arXiv:2410.03869},
  year   = {2025}
}

备注

Accepted by ACL 2025 Findings