最优学习率与批量大小扩展中的浪涌现象
机器学习
2024-10-29 v5
摘要
在当前深度学习任务中,Adam 系列优化器如 Adam、Adagrad、RMSProp、Adafactor 和 Lion 已广泛用作 SGD 系列优化器的替代方案。这些优化器通常根据梯度的符号来更新模型参数,从而导致收敛曲线更稳定。学习率和批量大小是优化器中最关键的超参数,需要精细调谐以实现有效收敛。先前的研究表明,最优学习率随批量大小线性增长或遵循类似规则,这适用于 SGD 系列优化器。然而,这一结论不适用于 Adam 系列优化器。本文通过理论分析和大量实验阐明了 Adam 系列优化器最优学习率与批量大小之间的关系。首先,我们提出了在梯度符号情况下的批量大小与最优学习率之间的扩展定律,证明了随着批量大小增加,最优学习率先上升后下降。此外,浪涌的峰值随着训练进行将逐渐移动到更大的批量大小上。其次,我们在 various CV 和 NLP 任务上进行了实验,验证了该扩展定律的正确性。
引用
@article{arxiv.2405.14578,
title = {Surge Phenomenon in Optimal Learning Rate and Batch Size Scaling},
author = {Shuaipeng Li and Penghao Zhao and Hailin Zhang and Xingwu Sun and Hao Wu and Dian Jiao and Weiyan Wang and Chengjun Liu and Zheng Fang and Jinbao Xue and Yangyu Tao and Bin Cui and Di Wang},
journal= {arXiv preprint arXiv:2405.14578},
year = {2024}
}