通过跨注意力激活投影实现概念无学习
计算机视觉与模式识别
2026-05-26 v1 人工智能
机器学习
摘要
概念无学习旨在擦除预训练文本到图像扩散模型中的目标概念,而无需重新训练。闭形式方法在此设置下显得尤为吸引,因为它们只需对跨注意力权重应用一次确定性编辑,且无需推理时间开销。然而,现有的闭形式方法将目标概念通过文本编码器对少量短锚定提示的响应来表示,而这些在命名概念的提示以及唤起该概念而不命名它的提示下,都能 consistent地 绕过该编辑。我们认为,目标应然而表示在跨注意力激活空间中。文本嵌入描述用户的提示,而跨注意力激活描述模型即将渲染的内容,后者对抗引导模板不覆盖的 paraphrased 提示具有更好的泛化能力。基于这一观察,我们提出PURE(U-Net渲染中的投影用于擦除),一种闭形式方法,从 denoising 轨迹沿多个层捕获的跨注意力激活构建忘记和保留基底,并对跨注意力键和值权重应用单个线性投影器。在最近一个涵盖艺术风格、知识产权、明星和NSFW类别中十个概念的holistic概念无学习基准测试中,PURE在paraphrased和对抗提示下显著减少目标泄漏,同时保持与未编辑模型接近的保留概念,实现了评估方法中最佳的忘记-保留权衡。
引用
@article{arxiv.2605.25765,
title = {Concept Unlearning via Cross-Attention Activation Projection for Diffusion Models},
author = {Saemi Moon and Suhyeon Jun and Seoyeon Lee and Dongwoo Kim},
journal= {arXiv preprint arXiv:2605.25765},
year = {2026}
}