中文

降级以升级:优化器简化增强了 LLM 无记忆的鲁棒性

机器学习 2026-04-21 v5

摘要

大型语言模型 (LLM) 无记忆旨在在保留与无关任务相关性的同时,精细地移除现有模型中对不良数据或知识的影响。这一范式在解决隐私和安全问题方面显示出前景。然而,最近的发现表明,无记忆效果往往脆弱:后续无记忆操作,如权重量化或微调,可能很快中和预期的遗忘。以往的改进鲁棒性的努力主要通过明确假设脆弱性来源来重新表述无记忆目标。在本工作中,我们从不同角度出发,探讨了优化器在无记忆目标和表述独立的情况下,对无记忆鲁棒性的作用。我们表明,优化器的“等级”,即其所利用信息的程度,从零阶(无梯度)到一阶(基于梯度)到二阶(基于 Hessian),与无记忆的韧性密切相关。令人惊讶的是,我们发现降级优化器,如使用零阶方法或压缩梯度变体(例如,梯度符号基于优化器),往往导致更强的鲁棒性。虽然这些优化器产生更噪声且更新不够精确的梯度,但它们鼓励收敛到难以扰动的损失景观中的局部极小值,从而抵抗后训练扰动。通过将零阶方法与随机平滑联系起来,我们进一步突出了其在鲁棒无记忆中的天然优势。鼓舞于这些见解,我们提出一种混合优化器,将一阶与零阶更新相结合,在保持无记忆有效性的同时增强鲁棒性。在 MUSE 和 WMDP 基准上进行的大量实验表明,我们的方法在多种 LLM 无记忆算法下,实现了更具韧性的遗忘,而不会牺牲无记忆质量。

关键词

引用

@article{arxiv.2510.00761,
  title  = {Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning},
  author = {Yicheng Lang and Yihua Zhang and Chongyu Fan and Changsheng Wang and Jinghan Jia and Sijia Liu},
  journal= {arXiv preprint arXiv:2510.00761},
  year   = {2026}
}