中文

调和现代深度学习与传统优化分析:内禀学习率

机器学习 2020-10-07 v1

摘要

近期工作(如 (Li and Arora, 2020))表明,当今深度学习中常用的归一化方案(包括批归一化)会使其偏离传统优化视角,例如使用指数增长的学习率。本文强调了归一化网络行为偏离传统视角的其他方式,进而通过一个对传统框架的适当改造来建立研究其数学基础的形式化框架,即借助一个合适的随机微分方程(SDE)对 SGD 诱导的训练轨迹建模,其中噪声项刻画梯度噪声。由此得到:(a) 一个新的“内禀学习率(intrinsic learning rate)”参数,它是常规学习率与权重衰减因子的乘积。对 SDE 的分析揭示了有效学习速度如何在内禀 LR 控制下随时间变化并达到平衡。(b) 通过理论与实验对“良好泛化需要在训练初期使用大学习率”这一流行观点的挑战。(c) 由数学直觉支撑的新实验,表明(函数空间中的)平衡步数随内禀学习率反比缩放,而非 SDE 分析所暗示的指数时间收敛界。我们将其命名为快速平衡猜想(Fast Equilibrium Conjecture),并认为它握有关键,解释了批归一化为何有效。

关键词

引用

@article{arxiv.2010.02916,
  title  = {Reconciling Modern Deep Learning with Traditional Optimization Analyses: The Intrinsic Learning Rate},
  author = {Zhiyuan Li and Kaifeng Lyu and Sanjeev Arora},
  journal= {arXiv preprint arXiv:2010.02916},
  year   = {2020}
}

备注

25 pages, 12 figures. Accepted By 34th Conference on Neural Information Processing Systems (NeurIPS 2020)