CURE:基于扩散模型正交表示编辑的概念遗忘方法
计算机视觉与模式识别
2025-10-14 v2
摘要
随着文本到图像模型的不断演进,生成不安全、受版权保护或侵犯隐私内容的风险也随之增加。现有的安全干预措施——包括训练数据精选、模型微调、推理时过滤和指导等——常常 suffer from 概念删除不完全、容易受到越狱攻击、计算效率低或对无关能力造成副作用。本文引入 CURE,一种无需训练的概念遗忘框架,直接在预训练扩散模型的权重空间中运行,实现对不良概念的快速、可解释且高度特定的抑制。在本方法核心是 Spectral Eraser(谱擦器),它通过对与待遗忘概念及保留概念相关的 token 嵌入进行奇异值分解,识别判别性子空间。直观地说,谱擦器识别并隔离唯一属于不良概念的特征,同时保留安全属性。该算子随后以单步更新应用于模型,得到经过编辑的模型,使目标概念有效地被遗忘——无需重新训练、监督或迭代优化。为平衡过滤有害内容与保留无关概念之间的权衡,我们进一步引入了用于谱正则化的 Expansion Mechanism(扩展机制),通过对奇异向量的相对重要性进行选择性调制,以控制遗忘强度。上述所有过程均为闭式解,保证仅需 秒钟即可实现极高效的擦除。在对比先前方法时,CURE 实现了对目标艺术风格、物体、身份或露骨内容的更高效和更彻底的删除,仅对原始生成能力造成轻微损伤,并在红队测试中表现出增强的鲁棒性。
引用
@article{arxiv.2505.12677,
title = {CURE: Concept Unlearning via Orthogonal Representation Editing in Diffusion Models},
author = {Shristi Das Biswas and Arani Roy and Kaushik Roy},
journal= {arXiv preprint arXiv:2505.12677},
year = {2025}
}