切口下的根基:揭示基于剪枝式遗忘技术在扩散模型中概念复活风险
计算机视觉与模式识别
2026-03-10 v1 机器学习
摘要
基于剪枝的遗忘技术最近涌现为一种快速、无需训练且与数据无关的从扩散模型中移除不良概念的方法,具有高度的效率和鲁棒性,为传统的微调或编辑式遗忘提供了引人注目的替代方案。然而,本文揭示了这一前景 Paradigm 背后隐藏的危险。我们发现,被剪枝的权重位置(通常在遗忘过程中被设置为零)可作为副信道信号,泄露有关被擦除概念的关键信息。为验证这一漏洞,我们设计了一个新颖的攻击框架,能够在完全无数据、无需训练的情况下复活被剪枝的扩散模型中的被擦除概念。我们的实验确认,基于剪枝的遗忘技术并非天然安全,因为可在无任何额外数据或重新训练的情况下有效复活被擦除的概念。大量实验表明,基于概念相关权重的扩散模型遗忘一旦关键概念相关权重被识别,本方法即可有效恢复原始概念,无论权重如何被操作。最后,我们探索了潜在的防御策略,提出更安全的剪枝机制,以隐藏剪枝位置同时保持遗忘效果,为设计更安全的基于剪枝的遗忘框架提供了实用见解。
引用
@article{arxiv.2603.06640,
title = {Roots Beneath the Cut: Uncovering the Risk of Concept Revival in Pruning-Based Unlearning for Diffusion Models},
author = {Ci Zhang and Zhaojun Ding and Chence Yang and Jun Liu and Xiaoming Zhai and Shaoyi Huang and Beiwen Li and Xiaolong Ma and Jin Lu and Geng Yuan},
journal= {arXiv preprint arXiv:2603.06640},
year = {2026}
}
备注
Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026