中文

各向异性梯度噪声下随机重球方法的加速收敛

机器学习 2024-03-19 v2 最优化与控制

摘要

衰减学习率的重球动量与SGD结合广泛用于深度学习模型的优化。与其经验上的流行性相反,对其理论性质的理解仍然相当有限,尤其是在二次回归问题的标准各向异性梯度噪声条件下。尽管普遍推测重球动量方法能够提供加速收敛,并且在大批量设置中应表现良好,但缺乏严格的理论分析。在本文中,我们通过建立随机重球方法在二次目标函数上采用步长衰减调度器时的非渐近收敛界,填补了这一理论空白,条件为各向异性梯度噪声。直接推论是,我们证明重球动量可以为SGD的偏差项提供O~(κ)\tilde{\mathcal{O}}(\sqrt{\kappa})的加速收敛,同时在随机方差项上仍能达到接近最优的收敛率。综合效果意味着整体收敛率在统计极小极大速率的对数因子内。这意味着带有重球动量的SGD在大批量设置(如分布式机器学习或联邦学习)中是有用的,其中较少的迭代次数可以显著减少通信轮数,从而在实践中实现加速。

关键词

引用

@article{arxiv.2312.14567,
  title  = {Accelerated Convergence of Stochastic Heavy Ball Method under Anisotropic Gradient Noise},
  author = {Rui Pan and Yuxing Liu and Xiaoyu Wang and Tong Zhang},
  journal= {arXiv preprint arXiv:2312.14567},
  year   = {2024}
}

备注

Published at ICLR 2024