中文

通过概念域纠正与概念保持梯度实现扩散模型中的概念忘卸

机器学习 2025-03-19 v3 计算机视觉与模式识别

摘要

文本到图像扩散模型在生成逼真图像方面取得了显著进展。然而,这些模型在预训练期间包含的敏感信息会带来显著风险。机器忘卸 (Machine Unlearning, MU) 为消除这些模型中的敏感概念提供了可行的解决方案。尽管存在潜力,但现有 MU 方法面临两个主要挑战:1) 泛化受限,即概念抹除仅在已忘卸的子集内有效,无法防止来自超出子集的提示生成敏感概念;以及2) 效用下降,即移除目标概念显著影响模型的整体性能。为此,我们提出了一种名为 DoCo (Do main Correction) 的新型概念域纠正框架,通过对抗训练对齐敏感概念和锚定概念的输出域,确保对目标概念的全面忘卸。此外,我们引入一种概念保持梯度手术技术,以减轻冲突梯度分量,从而在忘卸特定概念的同时保持模型的效用。广泛的实验在各种实例、风格和冒犯性概念上均表明,我们的方法能够以最小对相关概念影响的方式高效地忘卸目标概念,甚至在超出分布提示上也优于先前方法。

关键词

引用

@article{arxiv.2405.15304,
  title  = {Unlearning Concepts in Diffusion Model via Concept Domain Correction and Concept Preserving Gradient},
  author = {Yongliang Wu and Shiji Zhou and Mingzhuo Yang and Lianzhe Wang and Heng Chang and Wenbo Zhu and Xinting Hu and Xiao Zhou and Xu Yang},
  journal= {arXiv preprint arXiv:2405.15304},
  year   = {2025}
}

备注

AAAI 2025 camera-ready version