面向可迁移球面优化的语言模型扩展法
机器学习
2026-04-07 v2
摘要
大型语言模型的扩展规律在优化器和参数化方面至关重要。现有的超参数迁移规律主要针对一阶优化器developed,而且结构上不能防止规模化训练中的不稳定。最近的球面优化方法将权重矩阵约束到固定范数球面,为更稳定的扩展提供了有前景的替代方案。我们引入 HyperP (Hypersphere Parameterization),这是第一个在 Frobenius 球面约束下实现学习率跨模型宽度、深度、训练标记和混合专家 (MoE) 粒度迁移的框架。我们证明了在 Frobenius 球面上,权重衰减是一阶无操作;Depth-μP 仍然必要;且最优学习率遵循与 AdamW 之前观察到的“魔法指数”0.32相同的 data-scaling power law。一个基本学习率在最小规模调谐后,可在所有计算预算下迁移,yielding 在 6×10^{21} FLOPs 下相对于强大的 Muon 基线实现 1.58 倍的计算效率。此外,HyperP 提供可迁移的稳定性:所有监控的不稳定指标,包括 Z值、输出 RMS 和激活离群值,均保持受限且在训练 FLOPs 扩展下不增加。我们还提出 SqrtGate,这是一种从球面约束导出的 MoE 门控机制,保持输出 RMS 在 MoE 粒度间的一致性以实现更好的粒度扩展;并表明球面优化使更大范围的辅助负载平衡权重成为可能,既实现卓越性能又获得良好专家平衡。我们在 https://github.com/microsoft/ArchScale 上发布了我们的训练代码。
引用
@article{arxiv.2603.28743,
title = {Rethinking Language Model Scaling under Transferable Hypersphere Optimization},
author = {Liliang Ren and Yang Liu and Yelong Shen and Weizhu Chen},
journal= {arXiv preprint arXiv:2603.28743},
year = {2026}
}