中文

用于神经网络训练的阻尼牛顿随机梯度下降方法研究

机器学习 2021-04-01 v1 最优化与控制

摘要

随机梯度下降(SGD)等一阶方法近来是训练深度神经网络(DNNs)的流行优化方法,但二阶方法因获取高阶信息的计算代价过高而很少被使用。本文受已证明的“DNNs最后一层 Hessian 矩阵恒为半正定”这一事实启发,提出阻尼牛顿随机梯度下降(DN-SGD)方法与随机梯度下降阻尼牛顿(SGD-DN)方法,用于训练 DNNs 以解决均方误差(MSE)回归问题与交叉熵损失(CEL)分类问题。不同于其他估计所有参数 Hessian 矩阵的二阶方法,我们的方法仅精确计算一小部分参数,大幅降低了计算成本,并使学习过程的收敛比 SGD 更快、更准。我们在真实数据集上进行了若干数值实验,以验证所提方法在回归与分类问题上的有效性。

关键词

引用

@article{arxiv.2103.16764,
  title  = {Research of Damped Newton Stochastic Gradient Descent Method for Neural Network Training},
  author = {Jingcheng Zhou and Wei Wei and Zhiming Zheng},
  journal= {arXiv preprint arXiv:2103.16764},
  year   = {2021}
}

备注

10 pages