中文

JANUS:一种基于分布优化的文本到图像模型轻量级越狱框架

计算机视觉与模式识别 2026-03-27 v2 机器学习

摘要

文本到图像(T2I)模型如 Stable Diffusion 和 DALLE 在面对越狱攻击时仍容易生成有害或不适合工作场所(NSFW)内容,尽管部署了安全过滤器。现有越狱攻击要么依赖于代理损失优化而非真正的端到端目标,要么依赖于大规模且成本高昂的 RL 训练生成器。为了克服这些限制,我们提出了 JANUS,一个轻量级框架,将越狱问题形式化为在 T2I 系统及其安全过滤器的黑箱、端到端奖励下优化结构化提示分布。JANUS 用一个低维混合策略取代高容量生成器,对两个语义锚定的提示分布进行混合,既实现了高效探索,又保持了目标语义。在现代 T2I 模型上,我们在 Stable Diffusion 3.5 Large Turbo 上将 ASR-8 从 25.30% 提升至 43.15%,且始终保持更高的 CLIP 和 NSFW 分数。JANUS 在开源和商业模型上均表现出色。这一发现揭露了当前 T2I 安全管道的结构性弱点,推动了更强大的、分布感知的防御机制的研发。警告:本论文包含可能冒犯性的模型输出。

关键词

引用

@article{arxiv.2603.21208,
  title  = {JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimization},
  author = {Haolun Zheng and Yu He and Tailun Chen and Shuo Shao and Zhixuan Chu and Hongbin Zhou and Lan Tao and Zhan Qin and Kui Ren},
  journal= {arXiv preprint arXiv:2603.21208},
  year   = {2026}
}

备注

This paper is accepted by the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 18 pages, 8 figures