中文

Prompting4Debugging:通过寻找问题提示对文本到图像扩散模型进行红队测试

计算与语言 2026-01-15 v3 计算机视觉与模式识别

摘要

文本到图像扩散模型,例如 Stable Diffusion (SD),近来在高质量内容生成方面展现出卓越能力,并成为近期变革性 AI 浪潮的代表之一。然而,这一进展伴随着对该生成技术被滥用的日益加剧的担忧,尤其是用于生成受版权保护或 NSFW(即不适合工作场所)图像。尽管已有工作通过模型微调来过滤不适当的图像/提示或移除不良概念/风格,但这些安全机制在面对多样化问题提示时的可靠性在很大程度上仍未被探索。在本工作中,我们提出 Prompting4Debugging (P4D) 作为一种调试与红队测试工具,可自动为扩散模型寻找问题提示,以测试已部署安全机制的可靠性。我们展示了 P4D 工具在揭示带有安全机制的 SD 模型新漏洞方面的有效性。特别地,我们的结果表明,现有安全提示基准中约一半原本被认为“安全”的提示实际上可被操纵以绕过许多已部署的安全机制,包括概念移除、负向提示和安全引导。我们的发现表明,若无全面测试,基于有限安全提示基准的评估会给文本到图像模型带来虚假的安全感。

关键词

引用

@article{arxiv.2309.06135,
  title  = {Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts},
  author = {Zhi-Yi Chin and Chieh-Ming Jiang and Ching-Chun Huang and Pin-Yu Chen and Wei-Chen Chiu},
  journal= {arXiv preprint arXiv:2309.06135},
  year   = {2026}
}

备注

ICML 2024 main conference paper. The source code is available at https://github.com/zhiyichin/P4D