机器无知再训练等价性的不可实现性
机器学习
2025-10-31 v2
摘要
机器无知旨在选择性地移除特定训练数据对模型输出的"影响"。理想目标是再训练等价性——行为与仅在保留数据上从头训练的模型完全相同。该目标最初针对在独立同分布数据批次上训练的模型提出,但现代管道常涉及多阶段训练,每个阶段具有不同的数据分布和目标。例如包括 LLM 对齐、推理能力等在内的多阶段训练。我们的研究通过理论与实验表明,这种向多阶段训练的转变为机器无知引入了根本性障碍。理论表明,局部无知的结果是路径依赖的,即无知期间模型的行为受学习阶段顺序的影响,使得无视路径的算法无法实现通用的再训练等价性。我们在 Llama 和 Qwen 模型(从 1B 到 14B)上使用梯度上升、NPO 和 SimNPO 等局部无知算法进行实验,证明了相同训练阶段的不同排序导致模型在无知期间行为差异,GSM8K 准确率下降在不同路径间超过 20%。我们还观察到某些学习路径持续产生难以无知的模型。在无知期间,概率质量是被压缩到改写还是备用概念中也取决于路径。这些结果一致表明,对于采用多阶段训练的目标模型,局部无知算法的再训练等价性是一个不存在的目标。在模型训练历史难以获取的情境下,当前工作要求重新思考机器无知的定义与理想条件。
引用
@article{arxiv.2510.16629,
title = {On the Impossibility of Retrain Equivalence in Machine Unlearning},
author = {Jiatong Yu and Yinghui He and Anirudh Goyal and Sanjeev Arora},
journal= {arXiv preprint arXiv:2510.16629},
year = {2025}
}
备注
Code available at https://princeton-pli.github.io/impossibility-unlearning/