中文

可靠且高效的文本到图像扩散模型概念擦除

计算机视觉与模式识别 2024-10-29 v2

摘要

文本到图像模型面临安全问题,包括与版权和 Not-Safe-For-Work (NSFW) 内容相关的担忧。尽管已提出多种方法用于擦除扩散模型中的不当概念,但它们常常表现为擦除不彻底、消耗大量计算资源,并且不可避免地损伤生成能力。本文引入了可靠且高效的概念擦除 (RECE) 方法,通过修改模型在 3 秒钟内完成,不需要额外的微调。具体而言,RECE 有效利用闭式解来推导新的目标嵌入,这些嵌入能够在未经擦除的模型中再生 erased 概念。为缓解由派生嵌入潜在表示的不当内容,RECE 进一步将其与交叉注意力层中的无害概念对齐。派生和擦除新表示嵌入的过程以迭代方式进行,以实现对不当概念的彻底擦除。此外,为保留模型的生成能力,RECE 在派生过程中引入额外的正则化项,从而最小化擦除过程中对无关概念的影响。上述所有过程均为闭式解,确保仅用 3 秒钟即可实现极其高效的擦除。与以前的方法相比,本方法在更高效和更彻底的擦除方面取得优势,同时对原始生成能力的损伤最小,并对 red-teaming 工具表现出增强的鲁棒性。代码已提供:https://github.com/CharlesGong12/RECE。

关键词

引用

@article{arxiv.2407.12383,
  title  = {Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models},
  author = {Chao Gong and Kai Chen and Zhipeng Wei and Jingjing Chen and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2407.12383},
  year   = {2024}
}

备注

ECCV 2024 accepted