面向文本到图像系统的不适合工作内容检测——Wukong 框架
计算机视觉与模式识别
2026-01-21 v2 人工智能
密码学与安全
摘要
文本到图像(T2I)生成是一种流行的AI生成内容(AIGC)技术,能够实现多样化和创造性的图像合成。然而,部分输出可能包含不适合工作(NSFW)内容(如暴力),违反社区准则。高效准确地检测 NSFW 内容,称为外部监护,是必不可少的。现有的外部监护方法可分为两类:文本过滤器分析用户提示但忽视T2I模型特定变体且易受对抗攻击;图像过滤器分析最终生成的图像但计算成本高且引入延迟。扩散模型是现代T2I系统(如Stable Diffusion)的基础,through iterative denoising 使用包含 ResNet 和 Transformer 块的 U-Net 架构生成图像。我们观察到:(1)早期去噪步骤定义图像的语义布局;(2)U-Net中的跨注意力层对于对齐文本和图像区域至关重要。基于这些洞察,我们提出Wukong,一个基于Transformer的NSFW检测框架,利用早期去噪步骤的中间输出并重用U-Net的预训练跨注意力参数。Wukong在扩散过程中运行,实现早期检测而无需等待完整图像生成。我们还引入了一个新数据集,包含提示、随机种子和图像特定的NSFW标签,并在该数据集和两个公开基准数据集上评估Wukong。结果表明,Wukong显著优于文本式监护手段,实现了与图像过滤器相当的准确率,同时具有更高的效率。
引用
@article{arxiv.2508.00591,
title = {Wukong Framework for Not Safe For Work Detection in Text-to-Image systems},
author = {Mingrui Liu and Sixiao Zhang and Cheng Long},
journal= {arXiv preprint arXiv:2508.00591},
year = {2026}
}
备注
Accepted by KDD'26 (round 1)