论合成数据的多样性及其对训练大型语言模型的影响
计算与语言
2024-10-24 v2
摘要
大型语言模型(LLM)的兴起凸显了对多样化、高质量预训练数据的需求。合成数据成为解决数据稀缺和难以获取问题的可行方案。虽然以往的文献主要关注真实数据的质量和数量,但我们的工作能够衡量合成数据的多样性,并探索其对 LLM 性能的影响。我们通过引入一个新的多样性度量——\textit{LLM 聚类智能体}——来评估合成数据集的多样性,从而研究合成数据多样性在预训练和微调阶段的下游影响。通过一系列使用 350M 和 1.4B 参数模型的控制实验,我们证明了所提出的基于聚类的 LLM 多样性评分与预训练和监督微调性能均呈正相关。我们的发现还揭示了预训练中的合成数据多样性对监督微调的影响比预训练本身更显著,即使对于较小的模型也是如此。我们希望这项研究能增进我们对在 LLM 训练中最佳使用合成数据的理解,并为高效的数据生成过程开辟新途径。
引用
@article{arxiv.2410.15226,
title = {On the Diversity of Synthetic Data and its Impact on Training Large Language Models},
author = {Hao Chen and Abdul Waheed and Xiang Li and Yidong Wang and Jindong Wang and Bhiksha Raj and Marah I. Abdin},
journal= {arXiv preprint arXiv:2410.15226},
year = {2024}
}