模型崩溃是机器忘却中LLM的“bug”而是“特性”
机器学习
2026-03-03 v4 人工智能
摘要
当前的LLM忘却方法通过纳入要遗忘的私有信息来优化其在微调数据中的私有信息。我们认为这不仅风险加剧了对敏感数据的暴露,还根本与最小化其使用的原则相矛盾。作为补救,我们提出一种新颖的忘却方法——部分模型崩溃(PMC),其无需在忘却目标中包含忘却目标。我们的做法灵感来自最近的观察,即在其自身生成数据上训练生成模型会导致分布崩溃,有效地从模型输出中移除信息。我们的核心洞见是,模型崩溃可被利用用于机器忘却,通过故意为我们希望删除的数据触发崩溃。我们理论分析表明,我们的方法收敛于所需结果,即模型忘却被针对删除的数据。我们实证证明,PMC克服了四个关键局限性,这些局限性是显式优化忘却目标的现有方法,并且更有效地从模型输出中移除私人信息,同时保持一般模型实用性。总体而言,我们的贡献代表了更全面忘却的一个重要步骤,更好地与实际隐私约束相吻合。代码已在https://www.cs.cit.tum.de/daml/partial-model-collapse/提供。
引用
@article{arxiv.2507.04219,
title = {Model Collapse Is Not a Bug but a Feature in Machine Unlearning for LLMs},
author = {Yan Scholten and Sophie Xhonneux and Leo Schwinn and Stephan Günnemann},
journal= {arXiv preprint arXiv:2507.04219},
year = {2026}
}
备注
Accepted at ICLR 2026