中文

关于无调度优化器、AdEMAMix 与加速 SGD 变体之间的联系

机器学习 2025-02-05 v1 人工智能

摘要

深度学习优化的最新进步引入了新的算法,如无调度优化器、AdEMAMix、MARS 和 Lion,这些算法修改了传统的动量机制。在另一系列工作中,针对噪声主导 regime 下的随机梯度下降 (SGD) 进行理论加速,通过将动量系数从当前梯度的权重中解耦实现。在本文中,我们在这两个系列工作之间建立了明确的联系。我们通过在 1.5 亿参数语言建模任务上的初步实验来支撑我们的理论发现。我们发现,AdEMAMix 最接近随机梯度下降的加速版本,性能表现最佳。基于这些见解,我们引入了对 AdEMAMix 的一种修改,称为简化版 AdEMAMix (Simplified-AdEMAMix),该方法在大批量和小批量设置下均保持与 AdEMAMix 相同的性能,同时消除两个不同动量项的需求。Simplified-AdEMAMix 的代码已可用仓库提供:https://github.com/DepenM/Simplified-AdEMAMix/。

关键词

引用

@article{arxiv.2502.02431,
  title  = {Connections between Schedule-Free Optimizers, AdEMAMix, and Accelerated SGD Variants},
  author = {Depen Morwani and Nikhil Vyas and Hanlin Zhang and Sham Kakade},
  journal= {arXiv preprint arXiv:2502.02431},
  year   = {2025}
}