中文

退化微调:利用置乱网格屏蔽 Stable Diffusion 中的不良概念

计算机视觉与模式识别 2023-08-09 v2

摘要

由于训练数据中内容的无限制性,诸如 Stable Diffusion (SD) 等大型文本到图像扩散模型能够基于相应的文本概念信息生成可能受版权保护或具有危险性的内容,这包括特定的知识产权(IP)、人脸以及各种艺术风格。然而,作为一种广泛使用的内容移除方法,Negative Prompt 因其推理逻辑的内在局限,常常无法隐藏此类内容。在本工作中,我们提出一种名为退化微调(Degeneration-Tuning, DT)的新策略,以从 SD 权重中屏蔽不良概念的内容。通过利用置乱网格(Scrambled Grid)重构不期望概念与其对应图像域之间的关联,我们引导 SD 在输入此类文本概念时生成无意义内容。由于该适配发生在模型权重层面,经过 DT 的 SD 可被嫁接到其他条件扩散框架(如 ControlNet)上以屏蔽不良概念。除定性展示我们的 DT 方法在保护各类概念上的有效性外,对 DT 前后 SD 的定量比较表明,DT 方法并未显著影响其他内容的生成质量。模型在 COCO-30K 上的 FID 与 IS 分数在 DT 后仅发生微小变化,分别从 12.61 和 39.20 变为 13.04 和 38.25,明显优于先前方法。

关键词

引用

@article{arxiv.2308.02552,
  title  = {Degeneration-Tuning: Using Scrambled Grid shield Unwanted Concepts from Stable Diffusion},
  author = {Zixuan Ni and Longhui Wei and Jiacheng Li and Siliang Tang and Yueting Zhuang and Qi Tian},
  journal= {arXiv preprint arXiv:2308.02552},
  year   = {2023}
}