一种具有自适应梯度缩放类二阶优化器的深度学习方法
机器学习
2024-12-13 v2 人工智能
最优化与控制
摘要
在这篇实证文章中,我们介绍了INNAprop,一种结合了INNA方法和RMSprop自适应梯度缩放的优化算法。它利用了二阶信息和重新缩放,同时保持了标准深度学习方法(如AdamW或带动量的SGD)的内存需求。在给出几何见解后,我们在CIFAR-10、Food101和ImageNet上使用ResNets、VGG、DenseNet和ViT,以及在GPT-2(OpenWebText)上从头训练和使用LoRA微调(E2E)评估了INNAprop。INNAprop在训练速度和精度上始终匹配或优于AdamW,并且在大型设置中只需最少的超参数调整。我们的代码公开在\url{https://github.com/innaprop/innaprop}。
引用
@article{arxiv.2410.05871,
title = {A second-order-like optimizer with adaptive gradient scaling for deep learning},
author = {Jérôme Bolte and Ryan Boustany and Edouard Pauwels and Andrei Purica},
journal= {arXiv preprint arXiv:2410.05871},
year = {2024}
}