中文

GenBreak:利用大语言模型对文本到图像生成器进行红队测试

密码学与安全 2025-06-13 v1 计算与语言

摘要

文本到图像(T2I)模型如 Stable Diffusion 发展迅速,现已被广泛用于内容创作。然而,这些模型可能被滥用以生成有害内容,包括裸露或暴力,构成重大安全风险。尽管大多数平台采用内容审核系统,但底层漏洞仍可能被坚定的攻击者利用。最近针对 T2I 模型的红队研究和对抗攻击研究存在显著局限性:一些研究成功生成了高毒性图像,但使用的对抗提示容易被安全过滤器检测和拦截,而另一些研究专注于绕过安全机制但未能生成真正有害的输出,忽视了发现真正高风险提示。因此,目前仍缺乏可靠工具来评估受防御的 T2I 模型的安全性。为填补这一空白,我们提出了 GenBreak,一个通过微调红队大语言模型(LLM)来系统探索 T2I 生成器底层漏洞的框架。我们的方法结合了基于精选数据集的监督微调与通过与代理 T2I 模型交互的强化学习。通过整合多种奖励信号,我们引导 LLM 构建既能增强规避能力又能提高图像毒性的对抗提示,同时保持语义一致性和多样性。这些提示在对商业 T2I 生成器的黑箱攻击中表现出强大有效性,揭示了切实且令人担忧的安全弱点。

关键词

引用

@article{arxiv.2506.10047,
  title  = {GenBreak: Red Teaming Text-to-Image Generators Using Large Language Models},
  author = {Zilong Wang and Xiang Zheng and Xiaosen Wang and Bo Wang and Xingjun Ma and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2506.10047},
  year   = {2025}
}

备注

27 pages, 7 figures