中文

何时会从扩散模型中擦除概念?

机器学习 2025-11-10 v5 计算机视觉与模式识别

摘要

在概念擦除中,对模型进行修改,以选择性地防止其生成特定目标概念。尽管新方法快速发展,但仍不清楚这些方法是否彻底移除了目标概念。我们首先提出两种概念模型来解释扩散模型中的擦除机制:(i)干扰模型的内部引导过程;(ii)降低生成目标概念的无条件似然,可能彻底移除其。为了判断概念是否已从模型中真正擦除,我们引入了一套全面的独立探测技术:提供视觉上下文、修改扩散轨迹、应用分类器引导以及分析模型在被擦除概念取代时产生的备用生成。我们的结果阐明了探索概念擦除鲁棒性的价值——这不仅限于对抗性文本输入——并强调在扩散模型中进行擦除评估的重要性。

关键词

引用

@article{arxiv.2505.17013,
  title  = {When Are Concepts Erased From Diffusion Models?},
  author = {Kevin Lu and Nicky Kriplani and Rohit Gandikota and Minh Pham and David Bau and Chinmay Hegde and Niv Cohen},
  journal= {arXiv preprint arXiv:2505.17013},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025. Our code, data, and results are available at https://unerasing.baulab.info/