中文

面向文本到图像系统的不适合工作内容检测——Wukong 框架

计算机视觉与模式识别 2026-01-21 v2 人工智能 密码学与安全

摘要

文本到图像(T2I)生成是一种流行的AI生成内容(AIGC)技术,能够实现多样化和创造性的图像合成。然而,部分输出可能包含不适合工作(NSFW)内容(如暴力),违反社区准则。高效准确地检测 NSFW 内容,称为外部监护,是必不可少的。现有的外部监护方法可分为两类:文本过滤器分析用户提示但忽视T2I模型特定变体且易受对抗攻击;图像过滤器分析最终生成的图像但计算成本高且引入延迟。扩散模型是现代T2I系统(如Stable Diffusion)的基础,through iterative denoising 使用包含 ResNet 和 Transformer 块的 U-Net 架构生成图像。我们观察到:(1)早期去噪步骤定义图像的语义布局;(2)U-Net中的跨注意力层对于对齐文本和图像区域至关重要。基于这些洞察,我们提出Wukong,一个基于Transformer的NSFW检测框架,利用早期去噪步骤的中间输出并重用U-Net的预训练跨注意力参数。Wukong在扩散过程中运行,实现早期检测而无需等待完整图像生成。我们还引入了一个新数据集,包含提示、随机种子和图像特定的NSFW标签,并在该数据集和两个公开基准数据集上评估Wukong。结果表明,Wukong显著优于文本式监护手段,实现了与图像过滤器相当的准确率,同时具有更高的效率。

关键词

引用

@article{arxiv.2508.00591,
  title  = {Wukong Framework for Not Safe For Work Detection in Text-to-Image systems},
  author = {Mingrui Liu and Sixiao Zhang and Cheng Long},
  journal= {arXiv preprint arXiv:2508.00591},
  year   = {2026}
}

备注

Accepted by KDD'26 (round 1)