中文

通过对抗性保留擦除扩散模型中的不良概念

机器学习 2025-05-26 v4 计算机视觉与模式识别

摘要

扩散模型擅长从文本生成视觉上引人注目的内容,但在使用未经过滤的互联网数据训练时,可能会无意中产生不良或有害的内容。一个实用的解决方案是选择性地从模型中移除目标概念,但这可能会影响剩余概念。先前的方法试图通过引入一个损失项来保留中性内容,或引入一个正则化项来最小化模型参数的变化,从而平衡这一权衡,但解决这一权衡仍然具有挑战性。在这项工作中,我们提出识别并保留受参数变化影响最大的概念,称为“对抗性概念”。这种方法确保了稳定的擦除,同时对其他概念的影响最小。我们使用Stable Diffusion模型展示了我们方法的有效性,表明它在消除不需要的内容方面优于最先进的擦除方法,同时保持了其他无关元素的完整性。我们的代码可在https://github.com/tuananhbui89/Erasing-Adversarial-Preservation获取。

关键词

引用

@article{arxiv.2410.15618,
  title  = {Erasing Undesirable Concepts in Diffusion Models with Adversarial Preservation},
  author = {Anh Bui and Long Vuong and Khanh Doan and Trung Le and Paul Montague and Tamas Abraham and Dinh Phung},
  journal= {arXiv preprint arXiv:2410.15618},
  year   = {2025}
}

备注

Erasing Concepts, Generative Unlearning, NeurIPS 2024. arXiv admin note: text overlap with arXiv:2403.12326