用于神经网络训练的阻尼牛顿随机梯度下降方法研究
机器学习
2021-04-01 v1 最优化与控制
摘要
随机梯度下降(SGD)等一阶方法近来是训练深度神经网络(DNNs)的流行优化方法,但二阶方法因获取高阶信息的计算代价过高而很少被使用。本文受已证明的“DNNs最后一层 Hessian 矩阵恒为半正定”这一事实启发,提出阻尼牛顿随机梯度下降(DN-SGD)方法与随机梯度下降阻尼牛顿(SGD-DN)方法,用于训练 DNNs 以解决均方误差(MSE)回归问题与交叉熵损失(CEL)分类问题。不同于其他估计所有参数 Hessian 矩阵的二阶方法,我们的方法仅精确计算一小部分参数,大幅降低了计算成本,并使学习过程的收敛比 SGD 更快、更准。我们在真实数据集上进行了若干数值实验,以验证所提方法在回归与分类问题上的有效性。
引用
@article{arxiv.2103.16764,
title = {Research of Damped Newton Stochastic Gradient Descent Method for Neural Network Training},
author = {Jingcheng Zhou and Wei Wei and Zhiming Zheng},
journal= {arXiv preprint arXiv:2103.16764},
year = {2021}
}
备注
10 pages