OrScale:基于层级信任比例缩放的正交化优化
机器学习
2026-05-11 v1 计算与语言
摘要
Muon 通过对矩阵型更新进行正交化来改进神经网络训练,但其仍使每层的更新幅度主要由全局学习率控制。我们引入 OrScale,这是一种基于简单规则的 Muon 信任比例扩展:层级比率的分母应度量实际将要应用的参数空间方向的 Frobenius 范数。这一规则为通用矩阵层和面向语言模型的 OrScale-LM (将 Moonlight 形状缩放与一次性逐层校准相结合,使每个信任比率初始为 1)提供了实现。我们分析了三个自然的 Muon-LAMB 混合方案为何会失败:形状退化的分母、原始动量 clip 饱和以及解耦权重衰减的失控;并指出实用更新方向分母搭配耦合权重衰减可避免这些问题。理论上,OrScale 在核范数准则下可保证 的非凸收敛,在可测量的层级异质性下提供严格的层级自适应下降收益,并保持校准特性以保存 muP 风格的学习率迁移。实验上,OrScale 在 CIFAR-10/DavidNet 上以三个随机种子排名第一,将 Muon 的准确率从 93.70% 提升至 94.05%;OrScale-LM 在 125M 至 1.1B 参数规模的三个尺度上均优于 Muon+Moonlight,并在所有尺度上超越 AdamW。
关键词
引用
@article{arxiv.2605.07815,
title = {OrScale: Orthogonalised Optimization with Layer-Wise Trust-Ratio Scaling},
author = {Yuxuan Lou and Yang You},
journal= {arXiv preprint arXiv:2605.07815},
year = {2026}
}