面向多模态安全过滤器的文本到图像模型Jailbreaking的动态优化与安全指示注入
机器学习
2026-05-26 v2
摘要
文本到图像(T2I)模型可能生成不适合工作场所(NSFW)内容,动因是多阶段安全管道,包含文本和图像过滤器。较新的基于LLM的过滤器检测潜在意图,超越关键词,使基于token级扰动的攻击变得不可靠。我们的评估进一步表明,现有jailbreak方法在过滤规避和语义忠实度之间呈现尖锐的权衡,同时需要大量查询才能成功。我们引入OptJail,一个自动化jailbreak框架,结合动态提示优化与多模态反馈。它包含两个关键组件:(i)Dynamic Optimization,即利用文本过滤器反馈和语义一致性,将提示重写为对抗性变体的迭代过程;(ii)Adaptive Safety Indicator Injection,将良性视觉线索的注入形式化为强化学习问题,以规避图像级过滤器。OptJail实现了最佳性能,将ShieldLM-7B的绕过率从8.9%(Sneakyprompt)提高到99.0%,将CLIP分数从0.2637提高到0.2762。此外,它能够针对未见过的过滤器起作用,并在我们的评估中成功jailbreak DALL E 3。机制分析揭示了这些防御为何失效的原因:优化后的提示被投影到过滤器表示空间的“安全”区域,但在生成模型的语义空间中几乎保持不变;注入的安全指示将图像检测器注意力从NSFW内容重新导向对良性视觉线索。该研究揭示了当前多模态防御中的系统性漏洞,动因更强适应性防御。
引用
@article{arxiv.2505.18979,
title = {Dynamic Optimization and Safety Indicator Injection for Jailbreaking Text-to-Image Models with Multimodal Safety Filters},
author = {Zixuan Chen and Hao Lin and Ke Xu and Xinghao Jiang and Tanfeng Sun},
journal= {arXiv preprint arXiv:2505.18979},
year = {2026}
}