中文

有限权重平均的统一分析

机器学习 2024-11-21 v1 最优化与控制 机器学习

摘要

随机梯度下降(SGD)的迭代平均在训练深度学习模型中取得了经验成功,例如随机权重平均(SWA)、指数移动平均(EMA)和最新权重平均(LAWA)。特别是,使用有限权重平均方法,LAWA可以实现更快的收敛和更好的泛化。然而,其理论解释仍然较少探索,因为有限和无限设置之间存在根本差异。在这项工作中,我们首先将SGD和LAWA推广为有限权重平均(FWA),并从优化和泛化的角度解释它们相比SGD的优势。一个关键挑战是传统方法在期望或最优值意义上不适用于分析FWA收敛的无限维设置。其次,FWA引入的累积梯度给泛化分析带来了额外的混乱,尤其是在不同假设下讨论它们变得更加困难。将最终迭代收敛分析扩展到FWA,本文在凸性假设下建立了收敛界O(log(Tk)/T)\mathcal{O}(\log\left(\frac{T}{k}\right)/\sqrt{T}),其中k[1,T/2]k\in[1, T/2]是表示最后kk次迭代的常数。与SGD的O(log(T)/T)\mathcal{O}(\log(T)/\sqrt{T})相比,我们从理论上证明了FWA具有更快的收敛速度,并解释了平均点数量的影响。在泛化分析中,我们通过数学归纳法找到了一个用于界定累积梯度的递归表示。我们提供了常数和衰减学习率以及凸和非凸情况下的界,以展示FWA的良好泛化性能。最后,在几个基准上的实验结果验证了我们的理论结果。

关键词

引用

@article{arxiv.2411.13169,
  title  = {A Unified Analysis for Finite Weight Averaging},
  author = {Peng Wang and Li Shen and Zerui Tao and Yan Sun and Guodong Zheng and Dacheng Tao},
  journal= {arXiv preprint arXiv:2411.13169},
  year   = {2024}
}

备注

34 pages