Adam-mini:使用更少的学习率获得更多收益
机器学习
2025-02-25 v7 人工智能
摘要
我们提出了Adam-mini,一种优化器,其性能与AdamW相当或更好,同时内存占用减少50%。Adam-mini通过削减Adam中的学习率资源(即)来减少内存。通过研究神经网络的Hessian结构,我们发现Adam的可能并未像我们预期的那样充分发挥其潜力。我们发现,如果我们(1)根据我们关于Hessian结构的新原则仔细地将参数划分为块;(2)为每个参数块分配一个单一但良好的学习率,那么中≥99.9%的学习率可以被无害地移除。然后,我们提供了一种寻找良好学习率的简单方法,并提出了Adam-mini。实验上,我们验证了Adam-mini在从39M到13B的各种语言模型上,在预训练、监督微调和RLHF方面,性能与AdamW相当或更好。Adam-mini减少的内存占用也减轻了GPU之间的通信开销,从而提高了吞吐量。例如,在 A800-80GB GPU上预训练Llama 2-7B时,Adam-mini比AdamW实现了49.6%的更高吞吐量,节省了33%的预训练挂钟时间。
引用
@article{arxiv.2406.16793,
title = {Adam-mini: Use Fewer Learning Rates To Gain More},
author = {Yushun Zhang and Congliang Chen and Ziniu Li and Tian Ding and Chenwei Wu and Diederik P. Kingma and Yinyu Ye and Zhi-Quan Luo and Ruoyu Sun},
journal= {arXiv preprint arXiv:2406.16793},
year = {2025}
}