Nora:面向可扩展矩阵优化器的归一化正交行对齐
机器学习
2026-05-06 v1
摘要
矩阵型优化器在训练大型语言模型(LLM)方面展现了巨大潜力,但设计理想优化器仍是巨大挑战。优越优化器必须满足三个核心需求:效率,通过类 Muon 预条件化加速优化;稳定性,严格遵循神经网络内在的尺度不变性;速度,最小化计算开销。虽然现有方法在不同程度上解决这些问题,但往往未能统一,或导致计算成本高昂如 Muon,或允许径向抖动导致稳定性受损如 RMNP。为填补这一鸿沟,我们提出 Nora,一种严格满足所有三个要求的优化器。Nora 通过对权重的行向量动量投影到权重正交补上来显式稳定权重范数和角速度,从而实现训练稳定性。同时,凭借 Transformer Hessian 的块对角优势,Nora 有效近似结构化预条件化,同时保持最优计算复杂度 。我们进一步证明 Nora 是可扩展优化器,建立其对应的 scaling 定理。该方法实现简洁,仅需两行代码,初步实验表明 Nora 是大规模训练中高效且前景广阔的优化器。
引用
@article{arxiv.2605.03769,
title = {Nora: Normalized Orthogonal Row Alignment for Scalable Matrix Optimizer},
author = {Jinghui Yuan and Jiaxuan Zou and Shuo Wang and Yong Liu and Feiping Nie},
journal= {arXiv preprint arXiv:2605.03769},
year = {2026}
}