中文

面向文本到图像扩散模型的投影梯度无学习:对抗概念复活攻击的防御

计算机视觉与模式识别 2026-04-24 v1

摘要

文本到图像扩散模型的机器无学习旨在在不进行高成本再训练的情况下,从预训练模型中选择性地删除不可接受的概念。当前的无学习方法存在共同的弱点:即使在该数据与模型无关的情况下,被擦除的概念也会在模型进行下游微调后复活。我们将投影梯度无学习(Projected Gradient Unlearning, PGU)方法从分类领域推广到扩散领域,作为后处理的硬化步骤。通过从保留概念的激活值构建核心梯度空间(Core Gradient Space, CGS),并将梯度更新投影到其正交补中,PGU确保后续微调无法消除已实现的擦除。应用于ESD、UCE和Receler等现有方法后,PGU消除了对风格概念的复活,并显著延迟了对物体概念的复活,耗时约为6分钟,而Meta-Unlearning需要约2小时。PGU与Meta-Unlearning是互补的:哪种方法更好取决于概念的编码方式,保留概念的选择应遵循视觉特征相似性而非语义分组。

关键词

引用

@article{arxiv.2604.21041,
  title  = {Projected Gradient Unlearning for Text-to-Image Diffusion Models: Defending Against Concept Revival Attacks},
  author = {Aljalila Aladawi and Mohammed Talha Alam and Fakhri Karray},
  journal= {arXiv preprint arXiv:2604.21041},
  year   = {2026}
}