中文

局部 SGD 为何(以及何时)比 SGD 泛化更好?

机器学习 2023-03-10 v2

摘要

局部 SGD 是 SGD 的一种通信高效变体,用于大规模训练,其中多个 GPU 独立执行 SGD 并周期性地平均模型参数。最近观察到,局部 SGD 不仅能实现降低通信开销的设计目标,还能比相应的 SGD 基线带来更高的测试精度(Lin et al., 2020b),尽管发生这种情况的训练机制仍存在争议(Ortiz et al., 2021)。本文旨在基于随机微分方程(SDE)近似理解局部 SGD 为何(以及何时)泛化更好。本文的主要贡献包括:(i)推导了一个在小学习率机制下刻画局部 SGD 长期行为的 SDE,展示了在迭代点接近局部极小值流形后噪声如何驱动其漂移和扩散;(ii)比较局部 SGD 与 SGD 的 SDE,表明局部 SGD 诱导了更强的漂移项,可导致更强的正则化效应,例如更快的锐度下降;(iii)经验证据验证了具有小学习率和足够长的训练时间能够实现相对于 SGD 的泛化提升,但去掉任一条件均不会导致提升。

关键词

引用

@article{arxiv.2303.01215,
  title  = {Why (and When) does Local SGD Generalize Better than SGD?},
  author = {Xinran Gu and Kaifeng Lyu and Longbo Huang and Sanjeev Arora},
  journal= {arXiv preprint arXiv:2303.01215},
  year   = {2023}
}

备注

Published as a conference paper at ICLR 2023