中文

MuCon: 用于大语言模型训练的裁剪Muon更新

机器学习 2026-05-27 v1

摘要

Muon风格的优化器采用矩阵值动量或预条件更新 B=Udiag(σ1,,σr)VB = U \operatorname{diag}(\sigma_1,\ldots,\sigma_r) V^\top,并将其替换为其正则部分极因子 Pol(B)=UV\operatorname{Pol}(B) = U V^\top。这将每个非零奇异值映射为1。MuCon是本文研究的裁剪Muon变体:它对相同的Muon矩阵应用奇异值裁剪,DMuCon_τ(B)=MClip_τ(B)=Udiag(min{σ_i,τ})V,τ>0D^{\mathrm{MuCon}}\_\tau(B) = \operatorname{MClip}\_\tau(B) = U \operatorname{diag}\bigl(\min\{\sigma\_i,\tau\}\bigr) V^\top, \qquad \tau > 0。因此,MClip_τ\operatorname{MClip}\_\tau 表示数学裁剪算子,而MuCon表示用此裁剪方向替代Muon极方向的优化器原语。本工作中使用的Muon/MuCon缩放参数化称为SpectralP\text{SpectralP}:它是在此隐藏矩阵缩放方案下应用极Muon或裁剪MuCon方向。映射 MClip_τ\operatorname{MClip}\_\tau 是到谱范数球 {X:X2τ}\{X : \|X\|_2 \le \tau\} 的Frobenius投影:它保持奇异值小于或等于τ\tau的部分不变,仅修改违反约束的奇异方向。本文探讨了何时可以在不进行完整稠密SVD的情况下近似MuCon裁剪步骤。我们记录了两个精确恒等式,一个极/绝对值公式和一个标量根公式,引出了用于裁剪半正定因子的有理Newton滤波器,并指出了两者共同的数值障碍:接近阈值的奇异值使得符号决策和有理解变得病态。因此,矩阵函数方法只有在与稳定的极/平方根原语或裁剪边界附近的显式正则化配合时才有效。

关键词

引用

@article{arxiv.2605.26459,
  title  = {MuCon: Clipped Muon Updates for LLM Training},
  author = {Albert Yi},
  journal= {arXiv preprint arXiv:2605.26459},
  year   = {2026}
}