ARO:矩阵优化的新视角——针对大模型
机器学习
2026-02-10 v1 人工智能
最优化与控制
摘要
矩阵式优化器因提升 LLM 训练效率而受到日益关注,显著进展集中在正交化/白化基于方法上。虽然这些方法取得了显著的性能提升,但一个根本性问题随之而来:我们能否发展出超越正交化的新范式,进一步推动效率的前沿?我们提出了适应性旋转优化 (ARO),这是一种新的矩阵优化框架,将梯度旋转作为首要设计原则。ARO 通过在旋转坐标系中执行标称最陡下降来加速 LLM 训练,其中旋转由一种新颖的范数信息策略确定。这种视角产生超越现有正交化和白化优化器的更新规则,在实际操作中提高了样本效率。为确保比较可靠,我们提出了一种严格受控的基准测试协议,以减少混淆和偏差。在该协议下,ARO 在拥有最高 80 亿激活参数的 LLM 预训练中,相较于 AdamW 提升 ,相较于正交化方法提升 ,且在最高 的过度训练预算下仍无显著退步迹象。最后,我们讨论了如何将 ARO 重新表述为基于残差流旋转对称性的对称感知优化器,从而激发能够高效利用跨层/跨模块耦合的高级设计。
引用
@article{arxiv.2602.09006,
title = {ARO: A New Lens On Matrix Optimization For Large Models},
author = {Wenbo Gong and Javier Zazo and Qijun Luo and Puqian Wang and James Hensman and Chao Ma},
journal= {arXiv preprint arXiv:2602.09006},
year = {2026}
}