大语言模型时代学习率调度的再思考
机器学习
2023-09-19 v1
摘要
大语言模型(LLMs)代表了深度学习近期在取得类人预测性能方面的成功。由于 LLM 训练成本高昂,利用微调使 LLM 适应各种实际应用已成为主流策略。学习率是 LLM 微调中最重要的超参数之一,对微调效率和微调后 LLM 的质量均有直接影响。现有的学习率策略主要面向传统深度神经网络(DNNs)的训练而设计,可能并不适用于 LLM 微调。我们重新评估了大语言模型时代学习率调度的研究挑战与机遇。本文做出三项原创贡献。首先,我们重温现有学习率策略,分析 LLM 时代学习率调度的关键挑战。其次,我们提出 LRBench++ 以基准测试学习率策略,并促进传统 DNNs 与 LLMs 的学习率调度。第三,我们使用 LRBench++ 的实验分析展示了 LLM 微调与传统 DNN 训练之间的关键差异,并验证了我们的分析。
引用
@article{arxiv.2309.08859,
title = {Rethinking Learning Rate Tuning in the Era of Large Language Models},
author = {Hongpeng Jin and Wenqi Wei and Xuyu Wang and Wenbin Zhang and Yanzhao Wu},
journal= {arXiv preprint arXiv:2309.08859},
year = {2023}
}