以纪律为导向的扩散:针对 NSFW 生成的文本到图像扩散模型
计算机视觉与模式识别
2026-05-05 v1
摘要
文本到图像(T2I)扩散模型能够从文本提示构建高质量图像,但因可生成含有有害内容的图像而引发安全顾虑。现有安全过滤器通常依赖文本分类器或图像检查器,在检测到威胁时完全阻止输出,向用户发出明确的允许/阻止反馈信号。这种二进制策略使模型易受针对性攻击的威胁——通过修改关键词绕过检测——且易引发高误报率,损害良性用户体验。为此,我们提出 Disciplined Diffusion(DDiffusion),一种新型稳健文本到图像扩散模型,通过揭示提示嵌入中隐含的恶意语义来反击 Not Safe For Work(NSFW)生成。DDiffusion 利用语义检索机制评估提示与概念分布的关系,而非依赖脆弱的成对相似性。此外,它在扩散过程中采用局部化方法,仅编辑生成图像中有害区域。通过返回局部消毒图像而非统一屏蔽,DDiffusion 抑制恶意内容,同时保留良性提示的生成保真度,避免依赖现有探针攻击所依赖的二进制允许-拒绝信号。
引用
@article{arxiv.2605.01113,
title = {Disciplined Diffusion: Text-to-Image Diffusion Model against NSFW Generation},
author = {Chi Zhang and Changjia Zhu and Xiaowen Li and Yao Liu and Zhuo Lu},
journal= {arXiv preprint arXiv:2605.01113},
year = {2026}
}