随机梯度下降:尽可能快但不更快
机器学习
2017-09-06 v1 机器学习
神经与进化计算
摘要
当应用于训练深度神经网络时,随机梯度下降(SGD)经常会经历稳定的推进阶段,但被灾难性事件打断,其间损失和梯度范数爆炸。缓解此类事件的一种可能方法是放慢学习过程。本文提出一种控制SGD学习率的新方法,使用两个统计检验。第一个旨在快速学习,将归一化梯度向量的动量与随机单位向量的动量进行比较,并相应地平缓增加或降低学习率。第二个是变点检测检验,旨在检测灾难性学习事件;一旦触发,学习率立即减半。加速和减速学习率的双重能力使得所提方法(称为SALeRA)能够尽可能快但不更快地学习。在标准基准上的实验表明,SALeRA在实践中表现良好,并且优于最先进水平。
引用
@article{arxiv.1709.01427,
title = {Stochastic Gradient Descent: Going As Fast As Possible But Not Faster},
author = {Alice Schoenauer-Sebag and Marc Schoenauer and Michèle Sebag},
journal= {arXiv preprint arXiv:1709.01427},
year = {2017}
}