中文

FlowGuard:通过线性潜变量解码实现扩散模型的轻量级生成中安全检测

计算机视觉与模式识别 2026-04-10 v1 人工智能

摘要

基于扩散的图像生成模型发展迅速,但由于其可能生成不宜工作(NSFW)内容而带来安全风险。现有的NSFW检测方法主要在图像生成之前或之后运行。生成前方法依赖于文本提示,难以应对提示安全性与图像安全性之间的差距。生成后方法将分类器应用于最终输出,但难以适用于中间噪声图像。为解决此问题,我们引入了FlowGuard,一个跨模型的生成中检测框架,用于检查中间去噪步骤。这在潜变量扩散中尤其具有挑战性,因为早期阶段的噪声会掩盖视觉信号。FlowGuard采用一种新颖的线性近似方法进行潜变量解码,并利用课程学习方法来稳定训练。通过早期检测不安全内容,FlowGuard减少不必要的扩散步骤以降低计算成本。我们的跨模型基准测试涵盖九个基于扩散的主干网络,展示了FlowGuard在分布内和分布外场景下进行生成中NSFW检测的有效性,在F1分数上优于现有方法超过30%,同时带来了变革性的效率提升,包括将峰值GPU内存需求削减超过97%,并将投影时间从标准VAE解码的8.1秒降至0.2秒。

关键词

引用

@article{arxiv.2604.07879,
  title  = {FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding},
  author = {Jinghan Yang and Yihe Fan and Xudong Pan and Min Yang},
  journal= {arXiv preprint arXiv:2604.07879},
  year   = {2026}
}