扩散模型中概念擦除的绝佳目标及其寻找方法
机器学习
2025-05-26 v3 人工智能
计算机视觉与模式识别
摘要
概念擦除已成为一种有前景的技术,通过选择性遗忘不良概念来降低扩散模型生成有害内容的风险。以往工作的共同原则是将特定概念映射到一个固定的通用概念,例如中性概念或仅空文本提示。在本文中,我们证明这种固定目标策略是次优的,因为它未能考虑擦除一个概念对其他概念的影响。为解决这一局限性,我们将概念空间建模为图,并实证分析擦除一个概念对剩余概念的影响。我们的分析揭示了概念空间中有趣的几何性质,即擦除一个概念的影响局限于局部区域。基于这一发现,我们提出了自适应引导擦除(AGE)方法,该方法动态地为每个不良概念选择最优目标概念,从而最小化非预期的副作用。实验结果表明,AGE在保持无关概念的同时,显著优于最先进的擦除方法,且保持有效的擦除性能。我们的代码发布在https://github.com/tuananhbui89/Adaptive-Guided-Erasure。
引用
@article{arxiv.2501.18950,
title = {Fantastic Targets for Concept Erasure in Diffusion Models and Where To Find Them},
author = {Anh Bui and Trang Vu and Long Vuong and Trung Le and Paul Montague and Tamas Abraham and Junae Kim and Dinh Phung},
journal= {arXiv preprint arXiv:2501.18950},
year = {2025}
}