中文

除一之外:文本到图像扩散模型中保留模型的手术式概念擦除

计算机视觉与模式识别 2023-12-21 v1 人工智能

摘要

文本到图像模型(如 Stable Diffusion)得益于大规模数据集的使用,展现了令人印象深刻的图像生成合成能力。然而,这些数据集可能包含色情、受版权保护或不期望的内容,使得模型能够直接生成它们。鉴于针对单个概念删除请求重新训练这些大型模型不可行,研究人员开发了微调算法以解决扩散模型中的概念擦除问题。虽然这些算法能实现良好的概念擦除,但它们都存在以下问题之一:1) 受损的特征空间导致合成对象支离破碎;2) 初始合成内容在生成图像的空间结构和语义上发生偏离;3) 次优的训练更新增加了模型对效用损害 susceptibility。这些问题严重降低了生成模型的原始效用。在本工作中,我们提出了一种新方法来解决所有这些挑战。我们从分类器引导的概念中汲取灵感,提出对分类器引导项进行手术式更新,同时约束无条件分数项的漂移。此外,我们的算法使用户能够选择替代被擦除概念的方案,从而提供更高的可控性。实验结果表明,我们的算法不仅能有效擦除目标概念,还能保留模型的生成能力。

关键词

引用

@article{arxiv.2312.12807,
  title  = {All but One: Surgical Concept Erasing with Model Preservation in Text-to-Image Diffusion Models},
  author = {Seunghoo Hong and Juhun Lee and Simon S. Woo},
  journal= {arXiv preprint arXiv:2312.12807},
  year   = {2023}
}

备注

Main paper with supplementary materials