迈向更好泛化:深度神经网络训练中的 BP-SVRG
机器学习
2019-08-20 v1 机器学习
摘要
随机方差缩减梯度(SVRG)是一种经典的优化方法。尽管理论上已证明它比随机梯度下降(SGD)具有更好的收敛性能,但 SVRG 的泛化性能仍属未知。在本文中,我们研究了若干训练技巧、小批量化和学习率衰减对 SVRG 泛化性能的影响,并验证了批处理 SVRG(B-SVRG)的泛化性能。就优化与泛化之间的关系而言,我们认为每个训练样本上梯度的平均范数以及平均梯度的范数指示了损失地貌的平坦程度以及模型的泛化能力。基于对这些指标的实证观察,我们对 B-SVRG 执行符号切换并推导出实用算法 BatchPlus-SVRG(BP-SVRG),数值实验表明其在深度神经网络的某些场景下比 B-SVRG 甚至 SGD 具有更好的泛化性能。
引用
@article{arxiv.1908.06395,
title = {Towards Better Generalization: BP-SVRG in Training Deep Neural Networks},
author = {Hao Jin and Dachao Lin and Zhihua Zhang},
journal= {arXiv preprint arXiv:1908.06395},
year = {2019}
}