小批量大小对随机梯度下降中梯度方差的影响
最优化与控制
2020-04-29 v1 机器学习
摘要
小批量随机梯度下降(SGD)算法被广泛用于训练机器学习模型,特别是深度学习模型。我们通过关注梯度的方差,研究了线性回归和两层线性网络下的 SGD 动态(可轻松推广到更深的线性网络),这是此类性质的首次研究。在线性回归情况下,我们表明在每次迭代中梯度的范数是小批量大小 的递减函数,因此随机梯度估计器的方差是 的递减函数。对于具有 损失的深度神经网络,我们表明梯度的方差是 中的多项式。这些结果支持了重要的直觉,即较小的批量大小产生较低的损失函数值,这是研究人员中的普遍信念。证明技术展示了随机梯度估计器与初始权重之间的关系,这对进一步研究 SGD 的动态是有用的。我们在各种数据集和常用深度网络结构上以经验方式对我们的结果提供了进一步的见解。
引用
@article{arxiv.2004.13146,
title = {The Impact of the Mini-batch Size on the Variance of Gradients in Stochastic Gradient Descent},
author = {Xin Qian and Diego Klabjan},
journal= {arXiv preprint arXiv:2004.13146},
year = {2020}
}