中文

掩码更新在自适应优化器中的惊人有效性

机器学习 2026-02-18 v1 人工智能

摘要

大型语言模型(LLM)的训练几乎完全依赖密集自适应优化器,采用日益复杂的预条件化技术。我们挑战了这种做法,表明随机掩码参数更新实际上非常有效,掩码化RMSProp变体持续优于最新的SOTA优化器。我们的分析揭示,随机掩码会引起曲率依赖的几何正则化,从而平滑优化轨迹。基于这一发现,我们引入了动量对齐梯度掩码(Magma),该方法利用动量-梯度对齐来调制掩码更新。广泛的LLM预训练实验表明,Magma是一种简单可替代的自适应优化器,能够持续获得提升且计算开销可忽略不计。值得注意的是,对于10亿参数模型,Magma相对于Adam和Muon分别可降低19%和9%的困惑度。

关键词

引用

@article{arxiv.2602.15322,
  title  = {On Surprising Effectiveness of Masking Updates in Adaptive Optimizers},
  author = {Taejong Joo and Wenhan Xia and Cheolmin Kim and Ming Zhang and Eugene Ie},
  journal= {arXiv preprint arXiv:2602.15322},
  year   = {2026}
}

备注

Preprint