中文

面向LLM时代的高斯-牛顿取消学习

机器学习 2026-02-12 v1

摘要

标准的大语言模型训练可能会创建产生不可接受输出的模型。可通过诸如LLM取消学习等方法来降低这些输出的概率。然而,对忘记数据集(称为忘记集)进行取消学习可能会损害模型在其他分布上的性能。为改善这一权衡,我们展示,使用忘记集仅计算少量向上高斯-牛顿步骤提供了一种概念上简单且具备最新成果的取消学习方法,用于LLM。虽然高斯-牛顿步骤将牛顿方法适用于非线性模型,但对LLM而言高效且准确地计算此类步骤并不容易。因此,我们方法的关键依赖于如Kronecker-Factored Approximate Curvature(K-FAC)等参数化Hessian近似。我们称其为K-FADE(K-FAC for Distribution Erasure,即K-FAC分布擦除)。在WMDP和ToFU基准测试中的评估表明,K-FADE抑制了来自忘记集的输出,并在输出空间中近似再训练(不包含忘记集)的结果。关键的是,该方法在保持忘记集输出的同时,对保留集上的输出影响小于先前方法。这是因为K-FADE将整个保留集上模型输出的约束转化为模型权重的约束,使算法能够在每一步最小化改变模型在保留集上的行为。此外,K-FADE计算的取消学习更新稍后可重新应用,如果模型进一步训练,以便取消学习能够低成本地被维持。

关键词

引用

@article{arxiv.2602.10568,
  title  = {Gauss-Newton Unlearning for the LLM Era},
  author = {Lev McKinney and Anvith Thudi and Juhan Bae and Tara Rezaei and Nicolas Papernot and Sheila A. McIlraith and Roger Grosse},
  journal= {arXiv preprint arXiv:2602.10568},
  year   = {2026}
}

备注

18 pages