局部SGD通过利用损失函数的二阶信息加速收敛
机器学习
2023-05-29 v2
摘要
通过多次迭代更新,局部随机梯度下降(L-SGD)已被证明在联邦学习等分布式机器学习方案中极为有效。事实上,诸多创新工作表明,在独立同分布(IID)数据下L-SGD甚至优于SGD。因此,人们广泛致力于揭示L-SGD的能力。然而,现有分析未能解释为何使用小批量数据的多次局部更新(L-SGD)不能被一次大批量数据更新配合更大学习率(SGD)所替代。本文中,我们提供理解L-SGD优势的新视角。我们从理论上证明,在IID数据下,L-SGD能有效探索损失函数的二阶信息。具体而言,与SGD相比,L-SGD的更新在具有小特征值的Hessian矩阵特征向量上有大得多的投影,从而带来更快收敛。在特定条件下,L-SGD甚至可逼近牛顿法。在两个流行数据集上的实验结果验证了理论结论。
引用
@article{arxiv.2305.15013,
title = {Local SGD Accelerates Convergence by Exploiting Second Order Information of the Loss Function},
author = {Linxuan Pan and Shenghui Song},
journal= {arXiv preprint arXiv:2305.15013},
year = {2023}
}