中文

Muon 在 LoRA 风格矩阵分解中的均匀谱增长与收敛性

机器学习 2026-02-09 v1

摘要

谱梯度下降(SpecGD)对矩阵参数更新进行正交化,已激发实用优化器如 Muon 的出现。它们在大语言模型(LLM)训练中表现良好,但其动态仍鲜为人知。在低秩适应(LoRA)设置下,权重更新被参数化为两个低秩因子的乘积,我们发现 LoRA 微调中 Muon 的一个独特现象:LoRA 乘积的奇异值在谱上显示近乎均匀的增长,尽管对两个因子分别执行正交化。鼓励这一观察,我们在简化的 LoRA 风格矩阵分解设置中分析谱梯度流(SpecGF)——SpecGD 的连续时间类比,并证明“等速”动力学:所有奇异值的增长率在很小的偏差下保持相等。因此,较小的奇异值会比较大的奇异值更早达到其目标值,这与标准梯度流中观察到的从大到小的逐步学习形成鲜明对比。此外,我们证明在本设置下,SpecGF 从几乎所有初始条件收敛于全局最小值,前提是因子范数保持有界;加入 2\ell_2 正则化后可获得全局收敛。最后,我们在相同设置下进行实验以佐证理论。

关键词

引用

@article{arxiv.2602.06385,
  title  = {Uniform Spectral Growth and Convergence of Muon in LoRA-Style Matrix Factorization},
  author = {Changmin Kang and Jihun Yun and Baekrok Shin and Yeseul Cho and Chulhee Yun},
  journal= {arXiv preprint arXiv:2602.06385},
  year   = {2026}
}