大学习率驯服同质性:收敛与平衡效应
机器学习
2022-03-01 v2 动力系统
最优化与控制
摘要
最近的实证进展表明,使用大学习率训练深度模型通常能改善泛化性能。然而,由于分析上的挑战,关于大学习率益处的理论依据极为有限。在本文中,我们考虑在同质矩阵分解问题(即 )上使用具有大学习率的梯度下降 (GD)。我们证明了对于远超 的恒定大学习率的收敛理论,其中 是初始化处 Hessian 的最大特征值。此外,我们严格建立了由这种大学习率引起的 GD 的隐式偏置,称为“平衡”,意味着即使在 和 初始化显著不平衡时,GD 迭代极限处 和 的幅度也将接近。数值实验为我们的理论提供了支持。
引用
@article{arxiv.2110.03677,
title = {Large Learning Rate Tames Homogeneity: Convergence and Balancing Effect},
author = {Yuqing Wang and Minshuo Chen and Tuo Zhao and Molei Tao},
journal= {arXiv preprint arXiv:2110.03677},
year = {2022}
}
备注
45 pages