中文

关于 DNN 损失最陡方向与 SGD 步长的关系

机器学习 2019-12-24 v6 机器学习

摘要

基于随机梯度下降(SGD)的神经网络训练,若使用大学习率或小批量大小,通常会终止于权重空间中泛化良好、平坦的区域,这由训练损失 Hessian 矩阵的小特征值所表明。然而,沿 SGD 轨迹的曲率理解甚少。一项实证研究表明,初始阶段 SGD 会访问越来越陡的区域,达到由 SGD 的学习率和批量大小共同决定的最大锐度。当研究此初始阶段 SGD 动力学与最陡方向的关系时,我们发现 SGD 步长相对于曲率较大,且通常未能沿最陡方向最小化损失。此外,沿这些方向使用降低的学习率可提升训练速度,同时相较于原始 SGD 得到更陡且泛化更好的解。总之,我们对 SGD 在最陡方向子空间中动力学分析表明,它们影响 SGD 所导向的区域(较大学习率或较小批量导致访问更宽的区域)、整体训练速度以及最终模型的泛化能力。

关键词

引用

@article{arxiv.1807.05031,
  title  = {On the Relation Between the Sharpest Directions of DNN Loss and the SGD Step Length},
  author = {Stanisław Jastrzębski and Zachary Kenton and Nicolas Ballas and Asja Fischer and Yoshua Bengio and Amos Storkey},
  journal= {arXiv preprint arXiv:1807.05031},
  year   = {2019}
}