增长抑制器用于抑制扩散模型中的不当图像概念
计算机视觉与模式识别
2025-02-18 v2
摘要
尽管具有显著的图像生成能力,文本到图像扩散模型仍从大量未经筛选的训练数据中无意学习了不当概念,从而导致各种伦理和商业风险。具体而言,模型生成的图像可能包含不宜工作(NSFW)内容和风格版权侵权。导致这些问题的提示通常不包含明确的不安全词汇;相反,它们包含模糊和联想的术语,称为隐式不安全提示。现有方法在文本指导下直接微调模型以改变扩散模型的认知,从而擦除不当概念。这不仅需要针对特定概念的微调,还可能导致灾难性遗忘。为解决这些问题,我们探索了图像空间中不当概念的表示,并通过注入增长抑制器将其引导至更合适的概念,这些抑制器是根据扩散过程中识别的与不当概念相关的特征量身定制的。此外,由于不当概念的程度和范围各不相同,我们训练了一个适配器以在注入过程中推断相应的抑制规模。我们的方法能有效捕捉微妙词汇在图像层面的表现,实现对目标概念的直接高效擦除,而无需微调。通过大量实验,我们证明我们的方法在保留图像质量和语义的同时,在对其他概念影响极小的情况下取得了优越的擦除效果。
引用
@article{arxiv.2408.01014,
title = {Growth Inhibitors for Suppressing Inappropriate Image Concepts in Diffusion Models},
author = {Die Chen and Zhiwen Li and Mingyuan Fan and Cen Chen and Wenmeng Zhou and Yanhao Wang and Yaliang Li},
journal= {arXiv preprint arXiv:2408.01014},
year = {2025}
}