中文

从扩散模型中擦除概念

计算机视觉与模式识别 2023-06-22 v3

摘要

受近期文本到图像扩散进展的启发,我们研究从模型权重中擦除特定概念。尽管Stable Diffusion在生成露骨或写实艺术作品方面展现出潜力,但其潜在滥用风险已引发担忧。我们提出一种微调方法,可在仅给定风格名称且使用负引导作为教师的情况下,从预训练扩散模型中擦除视觉概念。我们将该方法与先前移除性露骨内容的方法进行基准比较,证明其有效性,表现与Safe Latent Diffusion及审查式训练相当。为评估艺术风格移除,我们进行了从网络中擦除五位现代艺术家的实验,并开展用户研究以评估人类对移除风格的感知。与先前方法不同,我们的方法可永久地从扩散模型中移除概念,而非在推理时修改输出,因此即使用户能访问模型权重也无法规避。我们的代码、数据与结果可在 https://erasing.baulab.info/ 获取。

关键词

引用

@article{arxiv.2303.07345,
  title  = {Erasing Concepts from Diffusion Models},
  author = {Rohit Gandikota and Joanna Materzynska and Jaden Fiotto-Kaufman and David Bau},
  journal= {arXiv preprint arXiv:2303.07345},
  year   = {2023}
}