深度神经网络优化轨迹上的盈亏平衡点
机器学习
2020-02-25 v1 机器学习
摘要
深度神经网络训练的早期阶段对其最终性能至关重要。本工作中,我们研究训练早期阶段所用的随机梯度下降(SGD)超参数如何影响其余优化轨迹。我们论证该轨迹上存在“盈亏平衡”点,超过此点后损失面的曲率与梯度中的噪声被SGD隐式正则化。特别地,我们在多个分类任务上证明,在训练初始阶段使用大学习率可降低梯度方差,并改善梯度协方差的条件数。这些效应从优化角度看是有益的,并在盈亏平衡点之后变得明显。作为对先前工作的补充,我们也展示即便对于带批量归一化层的神经网络,使用低学习率也会导致损失面条件数恶化。简言之,我们的工作表明损失面的关键性质在训练早期阶段受SGD强烈影响。我们认为研究所辨识效应对泛化的影响是一个有前景的未来方向。
引用
@article{arxiv.2002.09572,
title = {The Break-Even Point on Optimization Trajectories of Deep Neural Networks},
author = {Stanislaw Jastrzebski and Maciej Szymczak and Stanislav Fort and Devansh Arpit and Jacek Tabor and Kyunghyun Cho and Krzysztof Geras},
journal= {arXiv preprint arXiv:2002.09572},
year = {2020}
}
备注
Accepted as a spotlight at ICLR 2020. The last two authors contributed equally