中文

AA-DLADMM:一种基于 ADMM 的加速深度学习训练框架

机器学习 2024-01-09 v1 系统与控制 系统与控制

摘要

随机梯度下降(SGD)及其众多变体是训练深度神经网络的广泛使用的优化算法。然而,SGD 存在不可避免的缺点,包括梯度消失、缺乏理论保证以及对输入的高度敏感性。交替方向乘子法(ADMM)作为一种有效的基于梯度方法的替代方案被提出以解决这些不足,并已成功应用于深度神经网络的训练。然而,基于 ADMM 的优化器收敛速度较慢。本文提出了一种用于深度学习的 Anderson 加速 ADMM(AA-DLADMM)算法以克服这一缺点。AA-DLADMM 算法的主要意图是将 ADMM 视为不动点迭代并应用 Anderson 加速,从而获得近乎二次的收敛速率。我们通过在与其它最先进优化器对比的四个基准数据集上进行大量实验,验证了所提出的 AA-DLADMM 算法的有效性和效率。

关键词

引用

@article{arxiv.2401.03619,
  title  = {AA-DLADMM: An Accelerated ADMM-based Framework for Training Deep Neural Networks},
  author = {Zeinab Ebrahimi and Gustavo Batista and Mohammad Deghat},
  journal= {arXiv preprint arXiv:2401.03619},
  year   = {2024}
}

备注

18 pages, 5 figures, 5 tables