中文

NSFW-分类器引导的文本到图像生成提示规范化

计算机视觉与模式识别 2025-06-24 v1

摘要

文本到图像 (T2I) 模型的快速发展,如 Stable Diffusion,增强了其从文本提示合成图像的能力。然而,这一进展也带来了滥用风险,包括生成有害内容(如色情、暴力、歧视),这与 T2I 技术的伦理目标相矛盾,并阻碍了其可持续发展。鼓作于大型语言模型中的“越狱”攻击,这些攻击通过微妙的提示修改绕过限制,本文提出了一种新方法:NSFW-分类器引导的提示规范化 (PromptSan),用于在不改变模型架构或降低生成能力的情况下去除有害提示的意图。PromptSan 包括两个变体:PromptSan-Modify 通过在推理期间使用文本 NSFW 分类器迭代识别和替换输入提示中的有害标记;PromptSan-Suffix 则训练一序列优化后的后缀标记,以通过文本和图像 NSFW 分类器检查来中和有害意图。广泛实验表明,PromptSan 在多个指标上在减少有害内容生成方面实现了最佳性能,有效平衡了安全性和可用性。

关键词

引用

@article{arxiv.2506.18325,
  title  = {NSFW-Classifier Guided Prompt Sanitization for Safe Text-to-Image Generation},
  author = {Yu Xie and Chengjie Zeng and Lingyun Zhang and Yanwei Fu},
  journal= {arXiv preprint arXiv:2506.18325},
  year   = {2025}
}