学习率作为批量大小的函数:一种用于神经网络训练的随机矩阵理论方法
机器学习
2021-11-08 v6 机器学习
摘要
我们使用含尖峰的、场依赖的随机矩阵理论研究小批量对深度神经网络损失景观的影响。我们证明批量 Hessian 的极值幅度大于经验 Hessian 的极值幅度。我们还推导了 Hessian 的广义 Gauss-Newton 矩阵近似的类似结果。作为我们定理的结果,我们推导了最大学习率作为批量大小函数的解析表达式,为平滑非凸深度神经网络的随机梯度下降(线性缩放)和自适应算法(如 Adam(平方根缩放))的实际训练方案提供指导。虽然随机梯度下降的线性缩放在更严格的条件下已被推导,我们对其进行了推广,但据我们所知,自适应优化器的平方根缩放规则完全是新颖的。我们在 CIFAR- 和 ImageNet 数据集上的 VGG/WideResNet 架构上验证了我们的主张。基于我们对子采样 Hessian 的研究,我们开发了一种基于随机 Lanczos quadrature 的在线学习率和动量学习器,避免了对这些关键超参数进行昂贵的多次评估,并在 CIFAR- 的预残差架构上显示出良好的初步结果。
引用
@article{arxiv.2006.09092,
title = {Learning Rates as a Function of Batch Size: A Random Matrix Theory Approach to Neural Network Training},
author = {Diego Granziol and Stefan Zohren and Stephen Roberts},
journal= {arXiv preprint arXiv:2006.09092},
year = {2021}
}