遗忘的幻觉:通过初始隐变量优化攻击已遗忘的扩散模型
机器学习
2026-05-08 v2 人工智能
计算机视觉与模式识别
计算机与社会
摘要
文本到图像扩散模型(DMs)经常被滥用来生成有害或受版权保护的内容,侵犯公共利益。概念擦除(遗忘)是缓解此问题的一种有前景的范式。然而,存在一种原因不明的奇特遗忘幻觉现象。基于实证分析,我们正式解释了这一原因:大多数遗忘方法部分破坏了语言符号与底层内部知识之间的映射,使得知识作为休眠记忆保持完整。我们进一步证明,去噪过程中的分布差异可作为映射保留程度的可测量指标,也反映了遗忘强度。受此启发,我们提出了IVO(初始隐变量优化),一种旨在评估当前遗忘方法鲁棒性的新型攻击框架。IVO优化初始隐变量,以将已遗忘模型的噪声分布与其原始模型的噪声分布重新对齐,从而重建被破坏的映射,进而唤醒休眠记忆。涵盖11种遗忘技术和3种概念场景的大量实验表明,IVO优于最先进的基线方法,揭示了当前遗忘机制中的根本缺陷。警告:本文包含可能冒犯某些读者的不安全图像。
引用
@article{arxiv.2602.00175,
title = {The Illusion of Forgetting: Attack Unlearned Diffusion via Initial Latent Variable Optimization},
author = {Manyi Li and Yufan Liu and Lai Jiang and Bing Li and Yuming Li and Weiming Hu},
journal= {arXiv preprint arXiv:2602.00175},
year = {2026}
}
备注
25 pages, 12 figures, 12 tables