中文

深度 ReLU 网络中的最大初始学习率

机器学习 2023-05-29 v2 机器学习

摘要

训练神经网络需要选择合适的学习率,这涉及收敛速度与有效性之间的权衡。尽管关于学习率可大至何种程度的理论与实证分析已相当丰富,多数先前工作仅关注训练后期。在本工作中,我们引入最大初始学习率 η\eta^{\ast}——即随机初始化神经网络能够成功开始训练并达到(至少)给定阈值精度的最大学习率。使用一种简单方法估计 η\eta^{\ast},我们观察到在等宽全连接 ReLU 网络中,η\eta^{\ast} 的行为不同于训练后期的最大学习率。具体而言,我们发现只要(i)网络宽度相对于深度足够大,且(ii)输入层以相对较小的学习率训练,η\eta^{\ast} 就可很好地由深度 ×\times 宽度的幂次预测。我们进一步分析了 η\eta^{\ast} 与初始化时网络锐度 λ1\lambda_{1} 的关系,表明二者密切相关但并非反比关系。我们形式化地证明了以深度 ×\times 宽度表示的 λ1\lambda_{1} 的界,与我们的实证结果一致。

关键词

引用

@article{arxiv.2212.07295,
  title  = {Maximal Initial Learning Rates in Deep ReLU Networks},
  author = {Gaurav Iyer and Boris Hanin and David Rolnick},
  journal= {arXiv preprint arXiv:2212.07295},
  year   = {2023}
}

备注

International Conference on Machine Learning (ICML) 2023