AdamL:一种融入损失函数的快速自适应梯度方法
机器学习
2023-12-27 v1 机器学习
最优化与控制
摘要
自适应一阶优化器是深度学习中的基本工具,尽管由于非均匀梯度缩放,它们可能面临泛化性能不佳的问题。在这项工作中,我们提出了AdamL,一种Adam优化器的新变体,它考虑了损失函数信息以获得更好的泛化结果。我们提供了充分条件,结合Polyak-Lojasiewicz不等式,确保了AdamL的线性收敛。作为我们分析的副产品,我们证明了EAdam和AdaBelief优化器具有类似的收敛性质。在基准函数上的实验结果表明,与Adam、EAdam和AdaBelief相比,AdamL通常能实现最快的收敛或最低的目标函数值。在深度学习任务中,如训练卷积神经网络、使用普通卷积神经网络训练生成对抗网络以及长短期记忆网络,这些优越性能得到了证实。最后,在普通卷积神经网络的情况下,AdamL在Adam的其他变体中脱颖而出,并且在训练后期不需要手动调整学习率。
引用
@article{arxiv.2312.15295,
title = {AdamL: A fast adaptive gradient method incorporating loss function},
author = {Lu Xia and Stefano Massei},
journal= {arXiv preprint arXiv:2312.15295},
year = {2023}
}