针对文本到图像安全过滤器的低-effort 越狱攻击
计算机视觉与模式识别
2026-04-03 v1
摘要
文本到图像生成模型在创意工具和在线平台中广泛部署。为缓解滥用,系统依赖安全过滤器和审核管道以阻止有害或违规内容。在本工作中,我们展示了现代文本到图像模型仍然容易受到仅需自然语言提示即可实现的低-effort 越狱攻击。我们系统性地研究了无需模型访问、无需优化、无需对抗训练的提示基方法。我们引入了视觉越狱技术的分类体系,包括艺术性重构、材料替代、伪教育性表述、生活方式美学隐蔽以及模糊动作替代等。这些方法通过在良性语义语境中掩盖不安全意图来利用提示审核和视觉安全过滤的弱点。我们在多个最先进的文本到图像系统上评估了这些攻击,表明简单的语言修改即可可靠地规避现有安全措施并生成受限制的图像。我们的发现凸显了表层级提示过滤与检测生成媒体系统中对抗意图语义理解之间的关键差距。在所有测试模型和攻击类别中,我们观察到的攻击成功率 (ASR) 最高可达 74.47%。
引用
@article{arxiv.2604.01888,
title = {Low-Effort Jailbreak Attacks Against Text-to-Image Safety Filters},
author = {Ahmed B Mustafa and Zihan Ye and Yang Lu and Michael P Pound and Shreyank N Gowda},
journal= {arXiv preprint arXiv:2604.01888},
year = {2026}
}
备注
Text-to-Image version of the Anyone can Jailbreak paper. Accepted in CVPR-W AIMS 2026