深度学习的大学习率阶段:弹射机制
机器学习
2020-03-05 v1 机器学习
摘要
初始学习率的选择可对深度网络的性能产生深远影响。我们提出一类具有可解训练动力学的神经网络,并在实际深度学习设置中通过经验证实其预测。这些网络在小学习率与大学习率下表现出截然不同行为。两种机制由相变分隔。在小学习率阶段,训练可利用现有无限宽神经网络理论理解。在大学习率下,模型捕捉到定性上不同的现象,包括梯度下降动力学收敛至更平坦极小值。我们模型的一个关键预测是存在狭窄的大且稳定学习率范围。我们发现模型预测与现实深度学习设置中的训练动力学高度一致。此外,我们发现此类设置中的最优性能常出现在大学习率阶段。我们相信我们的结果阐明了以不同学习率训练模型的特征。特别是,它们填补了现有宽神经网络理论与实践中相关的非线性、大学习率训练动力学之间的空白。
引用
@article{arxiv.2003.02218,
title = {The large learning rate phase of deep learning: the catapult mechanism},
author = {Aitor Lewkowycz and Yasaman Bahri and Ethan Dyer and Jascha Sohl-Dickstein and Guy Gur-Ari},
journal= {arXiv preprint arXiv:2003.02218},
year = {2020}
}
备注
25 pages, 19 figures