Muon 是否可以微调基于 Adam 预训练的模型?
机器学习
2026-05-12 v1
摘要
Muon 作为 Adam 的高效替代方案已被广泛采用,但在微调任务中仍鲁能被使用。一个关键障碍是,大多数开放模型都是使用 Adam 进行预训练的,若直接切换到 Muon 进行微调,将导致性能下降,由于优化器之间的不匹配。我们通过受控实验检验这种不匹配,并将其与 Adam 与 Muon 不同的隐式偏差相关联。我们提供证据表明,这种不匹配会破坏预训练知识,且这种破坏程度随更新强度而增大。这导致我们假设,约束更新应能缓解不匹配。我们通过 LoRA 进行验证:在语言和视觉任务上,LoRA 显著缩小了在全参数微调下观察到的 Adam 与 Muon 之间的性能差距。关于 LoRA 的秩、灾难性遗忘以及 LoRA 变体的研究进一步确认,匹配程度的严重程度与更新强度相关。这些结果阐明了优化器不匹配如何影响微调以及如何加以缓解。我们的代码已公开于 https://github.com/XingyuQu/muon-finetune。
引用
@article{arxiv.2605.10468,
title = {Can Muon Fine-tune Adam-Pretrained Models?},
author = {Xingyu Qu and Peigeng Huang and Samuel Horvath},
journal= {arXiv preprint arXiv:2605.10468},
year = {2026}
}