分布式局部梯度方法的通信高效自适应批量尺寸策略
机器学习
2024-11-07 v2 机器学习
最优化与控制
摘要
现代深度神经网络因其庞大规模,往往需要大量 worker 进行分布式训练。随着 worker 数量的增加,通信开销成为数据并行 minibatch 随机梯度方法中进行逐迭代梯度同步的主要瓶颈。局部梯度方法(如 Local SGD)通过仅在多个本地步骤后同步模型参数或/和梯度来减少通信。尽管已对其收敛性有所了解,以及批量尺寸对训练效率和泛化能力的重要性已有认识,但确定局部梯度方法的最优批量尺寸仍然困难。我们引入局部梯度方法的自适应批量尺寸策略,通过自适应增加批量尺寸来降低 minibatch 梯度方差。我们在数据均匀条件下提供了收敛保证,并通过图像分类和语言建模实验验证了该策略在训练效率和泛化能力方面的有效性。
引用
@article{arxiv.2406.13936,
title = {Communication-Efficient Adaptive Batch Size Strategies for Distributed Local Gradient Methods},
author = {Tim Tsz-Kit Lau and Weijian Li and Chenwei Xu and Han Liu and Mladen Kolar},
journal= {arXiv preprint arXiv:2406.13936},
year = {2024}
}