步衰减调度:最小二乘问题中近最优的几何衰减学习率方法
机器学习
2019-10-30 v2 最优化与控制
机器学习
摘要
随机凸优化问题类的极大极小最优收敛速率已有充分刻画,其中多数结果利用具有多项式衰减步长的迭代平均随机梯度下降(SGD)。相比之下,尽管SGD的最终迭代在实践中被广泛使用,其相关行为却很少受到关注。受此启发,本文详细研究了以下问题:对于带强凸性与不带强凸性的流式最小二乘回归问题,使用SGD的最终迭代可达到何种速率?首先,本文表明即使提前已知时间范围T(即SGD运行的迭代次数),采用任意多项式衰减学习率方案的SGD最终迭代行为相比极大极小速率都高度次优(强凸情形下相差一个条件数因子,非强凸情形下相差 因子)。相反,本文表明步衰减(Step Decay)调度——即每常数个轮次将学习率按常数因子削减(即学习率几何衰减)——相比任意多项式衰减步长有显著改进。特别地,采用步衰减调度的最终迭代行为仅相差 因子(强凸情形为条件数相关,非强凸情形为T相关)便达到极大极小速率。最后,与已知时间范围情形形成鲜明对比,本文表明SGD最终迭代的任意时刻(即极限)行为较差(因其以极限上确界意义无限频繁地查询具有高度次优函数值的迭代),且与所用步长无关。这些结果揭示了在固定时间范围设定下为随机梯度方法的最终迭代建立最优学习率方案的微妙性。
引用
@article{arxiv.1904.12838,
title = {The Step Decay Schedule: A Near Optimal, Geometrically Decaying Learning Rate Procedure For Least Squares},
author = {Rong Ge and Sham M. Kakade and Rahul Kidambi and Praneeth Netrapalli},
journal= {arXiv preprint arXiv:1904.12838},
year = {2019}
}
备注
Appears in the proceedings of the Conference on Neural Information Processing Systems (NeurIPS), 2019. 28 pages, 4 tables, 1 Algorithm, 7 figures