一种通过抑制自适应步长范围改进 AdaBelief 的 DNN 优化器
机器学习
2023-01-25 v5
摘要
我们对改进自适应优化器性能做出贡献。我们的改进基于抑制 AdaBelief 优化器中自适应步长的范围。首先,我们表明 AdaBelief 更新表达式中参数 epsilon 的特定位置减小了自适应步长的范围,使 AdaBelief 更接近于带动量的 SGD。其次,我们通过进一步抑制自适应步长的范围来扩展 AdaBelief。为实现上述目标,我们在使用梯度 g_t 及其一阶动量 m_t 估计二阶动量之前,对二者进行互层向量投影。这一新优化方法被称为 Aida。第三,大量实验结果表明,在训练用于 NLP 的 transformers 和 LSTM,以及用于图像分类的 VGG 和 ResNet(基于 CIFAR10 和 CIFAR100)时,Aida 优于九种优化器;而在训练用于图像生成任务的 WGAN-GP 模型时,其性能与九种方法中的最佳者相当。此外,在 ImageNet 上训练 ResNet18 时,Aida 比 AdaBelief 产生更高的验证准确率。代码可在 <a href="https://github.com/guoqiang-x-zhang/AidaOptimizer">此 URL</a> 获取
引用
@article{arxiv.2203.13273,
title = {A DNN Optimizer that Improves over AdaBelief by Suppression of the Adaptive Stepsize Range},
author = {Guoqiang Zhang and Kenta Niwa and W. Bastiaan Kleijn},
journal= {arXiv preprint arXiv:2203.13273},
year = {2023}
}
备注
10 pages