理解局部SGD中的外部优化器:学习率、动量与加速
机器学习
2025-12-12 v2 最优化与控制
机器学习
摘要
现代机器学习通常需要大批量、分布式数据以及大规模并行计算硬件(如移动设备、其他边缘设备或分布式数据中心)进行训练。在此类场景下,通信成为主要瓶颈,但像局部随机梯度下降(Local SGD)这类方法在减少额外通信开销方面展现出巨大潜力。局部SGD由三部分组成:局部优化过程、聚合机制,以及一个使用来自各节点的聚合更新来生成新模型的外部优化器。尽管已有大量文献探讨局部优化过程中超参数的影响,但外部优化器的选择及其超参数的作用尚不明确。我们研究了外部优化器在Local SGD中的作用,并为该算法证明了新的收敛保证。特别地,我们表明调整外部学习率使我们能够(a)在优化误差与随机梯度噪声方差之间进行权衡,以及(b)弥补内部学习率调整不当的问题。我们的理论表明,外部学习率有时应设置为大于1的值。我们将结果扩展到在外部优化器中使用动量的场景,并展示了动量调整后的外部学习率具有类似作用。我们还研究了外部优化器中的加速,并证明它作为通信轮数的函数提高了收敛速度,优于先前在局部应用加速的算法的收敛速度。最后,我们还引入了一种新颖的、数据依赖的Local SGD分析,为外部学习率调整提供了更深入的见解。我们使用标准语言模型和各种外部优化器进行了全面实验,以验证我们的理论。
引用
@article{arxiv.2509.10439,
title = {Understanding Outer Optimizers in Local SGD: Learning Rates, Momentum, and Acceleration},
author = {Ahmed Khaled and Satyen Kale and Arthur Douillard and Chi Jin and Rob Fergus and Manzil Zaheer},
journal= {arXiv preprint arXiv:2509.10439},
year = {2025}
}