基于牛顿共轭梯度法在多GPU上的神经网络训练
机器学习
2022-08-04 v1 数值分析
数值分析
摘要
训练深度神经网络在许多计算中心消耗着日益增长的算力份额。通常,采用暴力搜索方式获取超参数值。我们的目标在于:(1)通过为大规模神经网络启用具有更少超参数的二阶优化方法来改进这一状况;(2)对针对特定任务的性能优化器进行调查,为用户的问题建议最佳优化器。我们引入了一种新颖的二阶优化方法,该方法仅需Hessian矩阵对向量的作用,而避免了为大规模网络显式构建Hessian矩阵的巨大开销。我们将所提出的二阶方法与两个SOTA优化器在五个具代表性的神经网络问题上进行比较,包括回归以及来自计算机视觉或变分自编码器的极深网络。针对最大规模的设置,我们利用Horovod对优化器进行了高效并行化,并将其应用于一台8 GPU NVIDIA P100(DGX-1)机器。
引用
@article{arxiv.2208.02017,
title = {Neural Nets with a Newton Conjugate Gradient Method on Multiple GPUs},
author = {Severin Reiz and Tobias Neckel and Hans-Joachim Bungartz},
journal= {arXiv preprint arXiv:2208.02017},
year = {2022}
}
备注
Accepted to PPAM conference