中文

XGrad:通过权重预测增强基于梯度的优化器

机器学习 2024-04-09 v2 人工智能

摘要

本文提出一种通用深度学习训练框架 XGrad,其将权重预测引入流行的基于梯度的优化器中,以在训练深度神经网络(DNN)模型时提升其收敛性与泛化能力。具体而言,在每个小批量训练之前,依据所用优化器的更新规则预测未来权重,并将其应用于前向传播与反向传播。如此,在整个训练期间,优化器始终利用相对于未来权重的梯度来更新 DNN 参数,使得基于梯度的优化器相较于无权重预测的原始优化器取得更好的收敛与泛化。XGrad 实现相当直接却非常有效地加速了基于梯度的优化器的收敛以及 DNN 模型的准确率。关于五种流行优化器(包括带动量的 SGD、Adam、AdamW、AdaBelief 与 AdaM3)的实证结果展示了我们方法的有效性。实验结果验证,在训练 DNN 模型时 XGrad 能比基线优化器获得更高的模型准确率。XGrad 的代码将发布于:https://github.com/guanleics/XGrad。

关键词

引用

@article{arxiv.2305.18240,
  title  = {XGrad: Boosting Gradient-Based Optimizers With Weight Prediction},
  author = {Lei Guan and Dongsheng Li and Yanqi Shi and Jian Meng},
  journal= {arXiv preprint arXiv:2305.18240},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2302.00195