REG:用于鲁棒训练动力学的正则化优化器
机器学习
2025-10-07 v1 人工智能
摘要
优化器是大语言模型(LLM)高效训练的关键因素。虽然AdamW是事实上的标准,但近期涌现出类似Muon等结构感知优化器,它们通过对整个权重矩阵上的操作来对梯度更新进行正则化。Muon优化器沿所有方向平衡梯度更新。然而,Muon对矩阵符号函数的依赖可能导致训练不稳定,并在微调使用AdamW预训练的模型时表现出不兼容性。为解决这些局限性,我们提出了一种新型优化器REG,用行列缩放(RACS)算子取代Muon的激进矩阵符号算子。RACS算子在理论上以矩阵平衡为依据,对更新步骤进行较不激进的正则化,使其更易于实现且更符合既定的训练动力学。通过对LLM训练的大量实证实验,我们展示我们的REG优化器不仅在性能和稳定性上优于AdamW,还能与AdamW训练范式保持一致。这一一致性在微调阶段尤为突出,REG优化器避免了Muon在微调中所观察到的性能下降。
引用
@article{arxiv.2510.03691,
title = {REG: A Regularization Optimizer for Robust Training Dynamics},
author = {Zehua Liu and Han Wu and Xiaojin Fu and Shuqi Liu and Xiongwei Han and Tao Zhong and Mingxuan Yuan},
journal= {arXiv preprint arXiv:2510.03691},
year = {2025}
}