基于无参数优化的 Sign-SGD
机器学习
2026-02-23 v4 最优化与控制
摘要
大语言模型已在各领域取得重大进展,但其训练仍然极其耗费资源。我们重新审视 Sign-SGD,它既可作为单节点训练的内存高效优化器,也可作为分布式学习的梯度压缩机制。本文解决了一个核心局限:有效步长无法先验确定,因为它依赖于未知的、问题特定的量。我们提出了一种无参数的 Sign-SGD,消除了手动步长选择。我们分析了确定性单节点情形,并将方法扩展到随机单节点训练和多节点设置。我们还将动量技术融入算法中,并提出了一种内存高效的变体,仅存储梯度符号而非完整梯度。我们在预训练 LLaMA 模型(130M 和 350M)和微调 Swin Transformer(28M)上评估了我们的方法。在考虑的任务中,所提出的方法在性能上与经过调参的 Sign-SGD 和 AdamW(使用余弦调度进行网格搜索步长)相当,同时避免了调参开销。采用无参数训练相比网格搜索步长的运行可获得约 1.5 倍的端到端加速。
引用
@article{arxiv.2506.03725,
title = {Sign-SGD via Parameter-Free Optimization},
author = {Daniil Medyakov and Sergey Stanko and Gleb Molodtsov and Philip Zmushko and Grigoriy Evseev and Egor Petrov and Aleksandr Beznosikov},
journal= {arXiv preprint arXiv:2506.03725},
year = {2026}
}
备注
60 pages, 7 figures, 11 tables