中文

ACE:扩散模型中的注意力概念擦除

计算机视觉与模式识别 2025-04-17 v1

摘要

大规模文本到图像扩散模型已展现出惊人的图像合成能力,但其对互联网规模数据的无差别训练导致学习到的概念能够生成有害、受版权保护或其他不可取的内容。我们聚焦扩散模型中的概念擦除任务,即从预训练模型中移除指定概念,以确保提示该概念(或相关同义词)时不再生成其表象,同时保持模型生成其他内容的能力。我们提出一种新方法——注意力概念擦除(ACE),其集成了闭式注意力操作与轻量级微调。理论上,我们将概念擦除形式化为将模型对目标概念的条件分布与中性分布对齐。我们的 метод 通过在交叉注意力模块中识别并消除概念特定潜在方向(采用带门控低秩适配),随后进行对抗性数据增强微调,以确保对概念及其同义词的彻底擦除。经验上,我们在多个基准测试中展示了 ACE 包括对象类别、明星面孔、隐晦内容和艺术风格在内的多种概念的领先的概念移除效果和鲁棒性。与先前方法相比,ACE 在通用性(擦除概念及相关术语)和特异性(保留无关内容)之间取得更好平衡,能够扩展到数十个概念,并且高效,只需每概念数秒即可完成适配。我们将发布代码以促进扩散模型的更安全部署。

关键词

引用

@article{arxiv.2504.11850,
  title  = {ACE: Attentional Concept Erasure in Diffusion Models},
  author = {Finn Carter},
  journal= {arXiv preprint arXiv:2504.11850},
  year   = {2025}
}

备注

Under Review