中文

优化器-模型一致性:使用与预训练相同的优化器进行全微调遗忘更少

机器学习 2026-05-08 v1 人工智能 最优化与控制

摘要

在训练大型语言模型(LLM)时,优化器在预训练和微调阶段都发挥着重要作用。在本文中,我们提出一项观察:在监督微调(SFT)阶段,使用与预训练相同的优化器进行全微调,相比其他优化器甚至可能令人惊讶地相比 LoRA,能实现更好的学习-遗忘权衡,即在实现相同或更好的新任务性能的同时遗忘更少。我们将此现象称为优化器-模型一致性。为了更好地理解它,通过受控实验和理论分析,我们表明:1) 优化器可以通过对激活产生正则化效应来塑造模型,从而在预训练检查点周围形成不同的损失景观;2) 为了应对这种正则化效应,SFT 中的权重更新应遵循某些特定结构以减少对预训练中所学知识的遗忘,而这可以通过使用相同的优化器来实现。此外,我们专门比较了 Muon 和 AdamW 在贯穿预训练和 SFT 阶段使用时的表现,发现 Muon 在针对推理任务进行微调时表现更差。通过一个合成语言建模实验,我们证明这可能源于 Muon 对死记硬背的强烈倾向,这可能会损害在数据量较少时的模式获取,正如 SFT 中的情况。

关键词

引用

@article{arxiv.2605.06654,
  title  = {Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less},
  author = {Yuxing Liu and Jianyu Wang and Tong Zhang},
  journal= {arXiv preprint arXiv:2605.06654},
  year   = {2026}
}