距离感知的 Muon:归一化优化中的自适应步长缩放
机器学习
2026-05-20 v1
摘要
Muon 及其相关归一化优化器将更新方向的选择与步长尺度的选择解耦,但其实际性能仍对归一化步长的尺度敏感。我们研究 Muon 在一般范数几何中的自适应缩放规则,开发了三个互补的算法。对于光滑非凸目标,引入距离自适应 Muon,其信任区域半径基于轨迹探索的半径设置,并在受限轨迹假设下证明了收敛性保证。随后我们转向星凸目标——一种用于推理深度神经网络经验损失景观的可处理全局几何模型,在此设置下,首先引入比例校准 Muon,保留 Muon 的指数移动平均,但根据当前梯度和动量计算的局部下降证书来确定步长。对于该方法,我们在受限初始子水平集假设下证明了最终 O(1/T) 目标差界,其中对应的半径参数仅出现在分析中而非算法中。最后,我们发展距离无感 Muon,一种重新中心化信任区域方法,使用标量距离证书和单维度搜索来选择信任区域半径,而无需知道初始化到全局最小值的距离。在 Transformer 语言建模 (GPT-124M/WikiText-103) 和图像分类 (ViT-Tiny/CIFAR-100) 实验中,表明所提出的自适应缩放规则减少了对手动尺度调谐的敏感性,并在所测试预算下匹配或改进了调谐固定尺度 Muon 基线。
引用
@article{arxiv.2605.18999,
title = {Distance-Aware Muon: Adaptive Step Scaling for Normalized Optimization},
author = {Yury Demidovich and Abhishek Chakraborty and Grigory Malinovsky and Angelia Nedić and Peter Richtárik},
journal= {arXiv preprint arXiv:2605.18999},
year = {2026}
}