中文

深度神经网络优化轨迹上的盈亏平衡点

机器学习 2020-02-25 v1 机器学习

摘要

深度神经网络训练的早期阶段对其最终性能至关重要。本工作中,我们研究训练早期阶段所用的随机梯度下降(SGD)超参数如何影响其余优化轨迹。我们论证该轨迹上存在“盈亏平衡”点,超过此点后损失面的曲率与梯度中的噪声被SGD隐式正则化。特别地,我们在多个分类任务上证明,在训练初始阶段使用大学习率可降低梯度方差,并改善梯度协方差的条件数。这些效应从优化角度看是有益的,并在盈亏平衡点之后变得明显。作为对先前工作的补充,我们也展示即便对于带批量归一化层的神经网络,使用低学习率也会导致损失面条件数恶化。简言之,我们的工作表明损失面的关键性质在训练早期阶段受SGD强烈影响。我们认为研究所辨识效应对泛化的影响是一个有前景的未来方向。

关键词

引用

@article{arxiv.2002.09572,
  title  = {The Break-Even Point on Optimization Trajectories of Deep Neural Networks},
  author = {Stanislaw Jastrzebski and Maciej Szymczak and Stanislav Fort and Devansh Arpit and Jacek Tabor and Kyunghyun Cho and Krzysztof Geras},
  journal= {arXiv preprint arXiv:2002.09572},
  year   = {2020}
}

备注

Accepted as a spotlight at ICLR 2020. The last two authors contributed equally