SGDR:带预热重启的随机梯度下降
机器学习
2017-05-04 v5 神经与进化计算
最优化与控制
摘要
重启技术在无梯度优化中常用于处理多峰函数。部分预热重启在基于梯度的优化中也日益流行,用以改善加速梯度格式中处理病态函数的收敛速率。在本文中,我们提出了一种简单的随机梯度下降预热重启技术,以在训练深度神经网络时改善其任意时刻性能。我们在 CIFAR-10 和 CIFAR-100 数据集上对其性能进行了实证研究,分别取得了 3.14% 和 16.21% 的新最优(state-of-the-art)结果。我们还在一个 EEG 记录数据集和下采样版本的 ImageNet 数据集上展示了其优势。我们的源代码可在 https://github.com/loshchil/SGDR 获取。
引用
@article{arxiv.1608.03983,
title = {SGDR: Stochastic Gradient Descent with Warm Restarts},
author = {Ilya Loshchilov and Frank Hutter},
journal= {arXiv preprint arXiv:1608.03983},
year = {2017}
}
备注
ICLR 2017 conference paper