当缩放遇上大语言模型微调:数据、模型与微调方法的影响
计算与语言
2024-02-28 v1 机器学习
摘要
虽然大语言模型(LLM)常采用微调以释放其在下游应用中的能力,但我们对不同微调方法的归纳偏置(尤其是缩放特性)的理解仍然有限。为填补这一空白,我们开展了系统性实验,研究包括 LLM 模型规模、预训练数据规模、新微调参数规模和微调数据规模在内的不同缩放因子是否以及如何影响微调性能。我们考虑了两种微调类型——全模型微调(FMT)和参数高效微调(PET,包括 prompt tuning 和 LoRA),并探索了它们在 LLM 模型规模远超微调数据规模的数据受限机制下的缩放行为。基于两组从 1B 到 16B 的预训练双语 LLM,以及在双语机器翻译和多语言摘要基准上的实验,我们发现:1) LLM 微调遵循微调数据规模与其他各缩放因子之间基于幂律的乘法联合缩放定律;2) LLM 微调从 LLM 模型缩放中获益多于预训练数据缩放,而 PET 参数缩放通常无效;3) 最优微调方法高度依赖于任务和微调数据。我们希望我们的发现能为理解、选择和发展 LLM 微调方法提供启示。
引用
@article{arxiv.2402.17193,
title = {When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method},
author = {Biao Zhang and Zhongtao Liu and Colin Cherry and Orhan Firat},
journal= {arXiv preprint arXiv:2402.17193},
year = {2024}
}
备注
ICLR24