Forget as Competition: 将遗忘重新定义为扩散模型中的表示干扰
机器学习
2026-05-19 v2 人工智能
摘要
部署中的文本到图像扩散模型日益需要在版权主张、艺术家opt-out、安全更新及受保护内容缓解等情况下进行后续概念遗忘,而无需完全重新训练。核心挑战在于擦除-保留不平衡:激进更新抑制目标但损伤共享能力,而保守或锚定更新则保留质量,却使概念通过相关、组合、措辞或对抗提示仍可恢复。受逆反干扰启发,我们提出SurgUn,将遗忘视为受控竞争而非直接删除或一对一重新分配。SurgUn通过干扰条件梯度竞争实现逆向概念干扰:对目标梯度执行上升以削弱目标条件去噪或流匹配行为,同时对语义多样化干扰集执行下降,引入竞争性非目标轨迹于相同提示情境下。这将输出在多个非目标模式间 redistributed,而非坍缩至单一代理。为限制通过共享通道的collateral遗忘,SurgUn加入像素锚定权空间局部化,一种轻量级诊断工具,按生成图像擦除-保留行为筛选注意力块,利用抑制可广泛实现而保留则块选择性的不对称性。跨UnlearnCanvas、IP-character erasure、Holistic Unlearning、EraseBench及Ring-A-Bell测试于Stable Diffusion v1.5、SDXL及SANA-1.5上,SurgUn在擦除-保留平衡上优于基线。消融实验表明,多样化干扰、对比竞争与局部化对稳健抑制同时保留相关及不相关概念均至关重要。
引用
@article{arxiv.2603.00975,
title = {Forgetting is Competition: Rethinking Unlearning as Representation Interference in Diffusion Models},
author = {Ashutosh Ranjan and Vivek Srivastava and Shirish Karande and Murari Mandal},
journal= {arXiv preprint arXiv:2603.00975},
year = {2026}
}