中文

mL-BFGS: 一种基于动量的 L-BFGS 用于分布式大规模神经网络优化

机器学习 2023-07-27 v1 最优化与控制

摘要

拟牛顿法在训练大规模神经网络时仍面临显著挑战,原因在于与 Hessian 相关的计算带来额外计算成本,以及随机训练中的不稳定性问题。一种著名的方法 L-BFGS 利用历史参数与梯度变化高效近似 Hessian,但在随机训练中遭受收敛不稳定之苦。迄今为止,将 L-BFGS 适配于大规模随机训练的尝试带来了可观的额外开销,从而在挂钟时间上抵消了其收敛优势。本文中,我们提出 mL-BFGS,一种轻量的基于动量的 L-BFGS 算法,为拟牛顿 (QN) 方法在大规模分布式深度神经网络 (DNN) 优化中开辟道路。mL-BFGS 将几乎无成本的动量机制引入 L-BFGS 更新,并大幅降低 Hessian 中的随机噪声,从而在随机优化中稳定收敛。对于大规模模型训练,mL-BFGS 近似块对角 Hessian,由此可将计算与内存成本分布到所有计算节点。我们提供了 mL-BFGS 在随机设定下的收敛分析作为支撑。为探究 mL-BFGS 在大规模 DNN 训练中的潜力,我们使用 mL-BFGS 训练基准神经模型,并与基线 (SGD、Adam 及其他拟牛顿法) 比较性能。结果显示 mL-BFGS 取得了显著的迭代层面与挂钟加速。

关键词

引用

@article{arxiv.2307.13744,
  title  = {mL-BFGS: A Momentum-based L-BFGS for Distributed Large-Scale Neural Network Optimization},
  author = {Yue Niu and Zalan Fabian and Sunwoo Lee and Mahdi Soltanolkotabi and Salman Avestimehr},
  journal= {arXiv preprint arXiv:2307.13744},
  year   = {2023}
}

备注

Accepted to TMLR 2023 (21 pages, 8 figures)