D-CPT定律:面向大型语言模型的领域特定持续预训练缩放定律
计算与语言
2024-06-04 v1
摘要
大型语言模型(LLMs)的持续预训练(CPT)已被广泛用于扩展模型对特定下游领域(如数学和代码)的基本理解。对于领域特定LLM的CPT,一个重要问题是如何选择通用语料库(如Dolma、Slim-pajama)与下游领域语料库之间的最优混合比例。现有方法通常通过在一组混合比例上进行网格搜索来采用费力的人工努力,这需要高昂的GPU训练消耗成本。此外,我们无法保证所选比例对于特定领域是最优的。为解决现有方法的局限性,受性能预测缩放定律的启发,我们提出研究领域特定持续预训练的缩放定律(D-CPT定律),以决定不同规模LLM的最优混合比例,且训练成本可接受。具体来说,通过拟合D-CPT定律,我们可以使用有限实验的小规模训练成本轻松预测任意混合比例、模型规模和数据集规模下的通用和下游性能。此外,我们还将标准D-CPT定律扩展到跨领域设置,并提出跨领域D-CPT定律来预测目标领域的D-CPT定律,其中目标领域所需的训练成本非常小(约为正常训练成本的1%)。在六个下游领域的综合实验结果证明了我们提出的D-CPT定律和跨领域D-CPT定律的有效性和泛化能力。
引用
@article{arxiv.2406.01375,
title = {D-CPT Law: Domain-specific Continual Pre-Training Scaling Law for Large Language Models},
author = {Haoran Que and Jiaheng Liu and Ge Zhang and Chenchen Zhang and Xingwei Qu and Yinghao Ma and Feiyu Duan and Zhiqi Bai and Jiakai Wang and Yuanxing Zhang and Xu Tan and Jie Fu and Wenbo Su and Jiamang Wang and Lin Qu and Bo Zheng},
journal= {arXiv preprint arXiv:2406.01375},
year = {2024}
}