中文

通过外部条件实现扩散模型安全-for-work (SFW) 采样

计算机视觉与模式识别 2025-05-15 v1 机器学习

摘要

基于评分的生成模型 (Score-based generative models, SBM),即扩散模型,是图像合成的事实标准最佳技术。尽管其卓越的性能,SBM 最近因被诱导生成不适合工作 (safe-for-work, SFW) 内容而备受关注,例如暴力图像和非同意裸露内容。目前基于模型自身知识的防御方法已成为主流,多数需要微调。本文探讨了使用外部来源确保安全输出的可能性。我们的 SFW 采样器实施了条件轨迹纠正步骤,通过多模态模型作为条件来源,将样本引导远离所需区域。此外,利用对比语言图像预训练 (Contrastive Language Image Pre-training, CLIP),该方法允许用户定义 NSFW 类,这些类可以在不同设置下变化。我们在文本到图像 SBM Stable Diffusion 上的实验表明,所提出的 SFW 采样器有效减少了显性内容的生成,同时在独立 NSFW 检测器评估下与其他微调方法具有竞争力。此外,我们评估了 SFW 采样器对图像质量的影响,表明所提出的纠正方案在不需纠正时对样本影响微乎其微。我们的研究确认了 SFW 采样器适用于对齐 SBM 模型的潜力,以及使用模型无关条件防止不必要图像的可能性。

关键词

引用

@article{arxiv.2505.08817,
  title  = {Towards SFW sampling for diffusion models via external conditioning},
  author = {Camilo Carvajal Reyes and Joaquín Fontbona and Felipe Tobar},
  journal= {arXiv preprint arXiv:2505.08817},
  year   = {2025}
}

备注

Accepcted at IJCNN 2025