不稳定的遗忘:扩散模型中概念复出现的隐藏风险
机器学习
2025-09-29 v3 密码学与安全
计算机视觉与模式识别
摘要
文本到图像扩散模型依赖大规模网络数据集。从头训练它们计算成本高昂,因此开发人员往往倾向于对现有模型进行增量更新。这些更新通常组合新的概念或提高模型性能的微调步骤,以及为“遗忘”现有概念(如受版权保护的作品或包含色情内容)的“遗忘”步骤。在本文中,我们演示了一个关键且此前未知的漏洞:在这种范式下,即使在 benign、非对抗性条件下,对文本到图像扩散模型进行微调(针对看似不相关的图像),也会导致模型“重新学习”之前被“遗忘”的概念。我们通过一系列实验全面调查了这一现象的原因和范围,即我们称之为概念复现(concept resurgence),通过对 Stable Diffusion v1.4 和 Stable Diffusion v2.1 进行“概念遗忘”与后续微调的组合实验来实现。我们的发现凸显了增量模型更新的脆弱性,并对当前确保文本到图像扩散模型安全性和对齐性的方法提出了严严重的新担忧。
引用
@article{arxiv.2410.08074,
title = {Unstable Unlearning: The Hidden Risk of Concept Resurgence in Diffusion Models},
author = {Vinith M. Suriyakumar and Rohan Alur and Ayush Sekhari and Manish Raghavan and Ashia C. Wilson},
journal= {arXiv preprint arXiv:2410.08074},
year = {2025}
}
备注
30 pages, 20 figures