不再需要Adam:初始化时的学习率缩放足矣
机器学习
2024-12-18 v2 人工智能
摘要
在这项工作中,我们质疑了自适应梯度方法对于训练深度神经网络的必要性。SGD-SaI是对带动量的随机梯度下降(SGDM)的一种简单而有效的改进。SGD-SaI在初始化时对不同参数组执行学习率缩放(SaI),由它们各自的梯度信噪比(g-SNR)引导。通过调整学习率而不依赖自适应二阶动量,SGD-SaI有助于从第一次迭代开始防止训练不平衡,并将优化器的内存使用量相比AdamW减少一半。尽管简单高效,SGD-SaI在各种基于Transformer的任务训练中始终匹配或超越AdamW,有效克服了使用SGD训练Transformer的长期挑战。SGD-SaI在ImageNet-1K分类中使用Vision Transformers(ViT)以及用于大型语言模型(LLMs,仅解码器Transformer)的GPT-2预训练中表现出色,展示了其对超参数变化的鲁棒性和对多种应用的实用性。我们进一步测试了其在LLMs的LoRA微调和扩散模型等任务上的鲁棒性,在这些任务中它始终优于最先进的优化器。从内存效率的角度来看,SGD-SaI在优化器状态方面实现了显著的内存节省,在全精度训练设置中,与AdamW相比,GPT-2(1.5B参数)减少了5.93 GB,Llama2-7B减少了25.15 GB。
引用
@article{arxiv.2412.11768,
title = {No More Adam: Learning Rate Scaling at Initialization is All You Need},
author = {Minghao Xu and Lichuan Xiang and Xu Cai and Hongkai Wen},
journal= {arXiv preprint arXiv:2412.11768},
year = {2024}
}
备注
20 pages, 10 figures