中文

大学习率驯服同质性:收敛与平衡效应

机器学习 2022-03-01 v2 动力系统 最优化与控制

摘要

最近的实证进展表明,使用大学习率训练深度模型通常能改善泛化性能。然而,由于分析上的挑战,关于大学习率益处的理论依据极为有限。在本文中,我们考虑在同质矩阵分解问题(即 minX,YAXYF2\min_{X, Y} \|A - XY^\top\|_{\sf F}^2)上使用具有大学习率的梯度下降 (GD)。我们证明了对于远超 2/L2/L 的恒定大学习率的收敛理论,其中 LL 是初始化处 Hessian 的最大特征值。此外,我们严格建立了由这种大学习率引起的 GD 的隐式偏置,称为“平衡”,意味着即使在 XXYY 初始化显著不平衡时,GD 迭代极限处 XXYY 的幅度也将接近。数值实验为我们的理论提供了支持。

关键词

引用

@article{arxiv.2110.03677,
  title  = {Large Learning Rate Tames Homogeneity: Convergence and Balancing Effect},
  author = {Yuqing Wang and Minshuo Chen and Tuo Zhao and Molei Tao},
  journal= {arXiv preprint arXiv:2110.03677},
  year   = {2022}
}

备注

45 pages