Local SGD 在多项式时间内优化过参数化神经网络
机器学习
2022-02-23 v2 最优化与控制
摘要
在本文中,我们证明 Local (S)GD(或 FedAvg)能够在多项式时间内优化具有 Rectified Linear Unit(ReLU)激活函数的深度神经网络。尽管 Local SGD 在通信高效的分布式优化中针对一般平滑函数的收敛理论已经建立,但其在非平滑 ReLU 网络上的收敛仍缺乏完整的理论理解。许多针对平滑函数的 Local SGD 分析中使用的关键性质是梯度 Lipschitz 连续性,使得局部模型上的梯度不会偏离平均模型上的梯度太远。然而,这一良好性质在不具备非平滑 ReLU 激活函数的网络中并不成立。我们证明,尽管 ReLU 网络不具备梯度 Lipschitz 连续性,但在 Local SGD 的动力学下,局部模型上的梯度与平均模型上的梯度之间的差异不会变化太大。我们通过大量实验验证了理论结果。本工作是首个证明 Local SGD 在非平滑函数上收敛的工作,并将为深度神经网络的联邦训练优化理论提供启示。
引用
@article{arxiv.2107.10868,
title = {Local SGD Optimizes Overparameterized Neural Networks in Polynomial Time},
author = {Yuyang Deng and Mohammad Mahdi Kamani and Mehrdad Mahdavi},
journal= {arXiv preprint arXiv:2107.10868},
year = {2022}
}