通过大语言模型对受保护的文本到图像模型进行越狱
密码学与安全
2026-01-09 v2 人工智能
计算与语言
计算机视觉与模式识别
摘要
文本到图像模型可能会生成有害内容,例如色情图像,尤其是在提交不安全的提示词时。为解决此问题,常会在文本到图像模型上方添加安全过滤器,或使模型本身针对减少有害输出进行对齐。然而,这些防御措施在攻击者策略性地设计对抗性提示以绕过这些安全护栏时仍然脆弱。本文我们提出 \alg 方法,使用微调后的大语言模型对带有安全护栏的文本到图像模型进行越狱。与其他需要针对目标模型重复查询的查询式越狱攻击不同,我们的方法在微调我们的 AttackLLM 后即可高效生成对抗性提示。我们在三个不安全提示数据集和五个安全护栏上对我们的方法进行了评估。我们的结果表明,我们的方法有效地绕过了安全护栏,超越了现有的 no-box 攻击,也促进了其他查询式攻击。
引用
@article{arxiv.2503.01839,
title = {Jailbreaking Safeguarded Text-to-Image Models via Large Language Models},
author = {Zhengyuan Jiang and Yuepeng Hu and Yuchen Yang and Yinzhi Cao and Neil Zhenqiang Gong},
journal= {arXiv preprint arXiv:2503.01839},
year = {2026}
}
备注
Accepted by EACL 2026 Findings