中文

用于扩展同步分布式 DNN 训练的非线性共轭梯度法

机器学习 2019-11-21 v2 机器学习

摘要

基于非线性共轭梯度(NLCG)的优化器在传统优化问题中相比基于梯度下降的优化器展现出更优的损失收敛特性。然而,在深度神经网络(DNN)训练中,主流的优化算法选择仍是随机梯度下降(SGD)及其变体。在本工作中,我们提出并评估了用于大规模 DNN 训练任务的随机预条件非线性共轭梯度算法。我们表明,非线性共轭梯度算法提升了 DNN 训练的收敛速度,尤其是在大 mini-batch 场景下,这对于将同步分布式 DNN 训练扩展到大量工作节点至关重要。我们展示了如何在 NLCG 预条件子中高效利用二阶信息以改善 DNN 训练收敛。对于 ImageNet 分类任务,在大于 65k 的极大 mini-batch 尺寸下,NLCG 优化器在标准训练 Resnet-50 模型 90 个 epoch 时能将 top-1 准确率提升超过 10 个百分点。对于 CIFAR-100 分类任务,在大于 16k 的极大 mini-batch 尺寸下,NLCG 优化器在标准训练 Resnet-32 模型 200 个 epoch 时能将 top-1 准确率提升超过 15 个百分点。

关键词

引用

@article{arxiv.1812.02886,
  title  = {Nonlinear Conjugate Gradients For Scaling Synchronous Distributed DNN Training},
  author = {Saurabh Adya and Vinay Palakkode and Oncel Tuzel},
  journal= {arXiv preprint arXiv:1812.02886},
  year   = {2019}
}

备注

10 pages