有限权重平均的统一分析
机器学习
2024-11-21 v1 最优化与控制
机器学习
摘要
随机梯度下降(SGD)的迭代平均在训练深度学习模型中取得了经验成功,例如随机权重平均(SWA)、指数移动平均(EMA)和最新权重平均(LAWA)。特别是,使用有限权重平均方法,LAWA可以实现更快的收敛和更好的泛化。然而,其理论解释仍然较少探索,因为有限和无限设置之间存在根本差异。在这项工作中,我们首先将SGD和LAWA推广为有限权重平均(FWA),并从优化和泛化的角度解释它们相比SGD的优势。一个关键挑战是传统方法在期望或最优值意义上不适用于分析FWA收敛的无限维设置。其次,FWA引入的累积梯度给泛化分析带来了额外的混乱,尤其是在不同假设下讨论它们变得更加困难。将最终迭代收敛分析扩展到FWA,本文在凸性假设下建立了收敛界,其中是表示最后次迭代的常数。与SGD的相比,我们从理论上证明了FWA具有更快的收敛速度,并解释了平均点数量的影响。在泛化分析中,我们通过数学归纳法找到了一个用于界定累积梯度的递归表示。我们提供了常数和衰减学习率以及凸和非凸情况下的界,以展示FWA的良好泛化性能。最后,在几个基准上的实验结果验证了我们的理论结果。
引用
@article{arxiv.2411.13169,
title = {A Unified Analysis for Finite Weight Averaging},
author = {Peng Wang and Li Shen and Zerui Tao and Yan Sun and Guodong Zheng and Dacheng Tao},
journal= {arXiv preprint arXiv:2411.13169},
year = {2024}
}
备注
34 pages