中文

你的数据真的能让你开心吗?来自数据域上采样训练末期的性能提升

机器学习 2024-06-06 v1 计算与语言

摘要

大型语言模型(LLMs)的预训练数据集已增长到数万亿 token,其中包含大量 CommonCrawl(CC)网页抓取数据以及较小的领域特定数据集。由于在大规模 FLOP 计算规模下训练成本高昂,难以理解这些领域特定数据集对模型能力的影响。鉴于实验预训练数据成本日益增加,如何确定通用网页抓取数据多样性与领域特定数据信息密度之间的最佳平衡点?本文我们展示了如何通过在训练末期对领域特定数据集进行相对于 CC 的上采样,以驱动对困难基准的性能提升。该简单技术使我们在 MMLU 上提升最多 6.90 pp,在 GSM8K 上提升 8.26 pp,在 HumanEval 上提升 6.17 pp,相对于 base 数据混合训练 1 万亿 token 的 7B 模型,thus 相当于训练了两倍时间的 Llama-2(7B)。我们实验性地对域上采样持续时间从 5% 到 30% 进行消融,发现 10% 到 20% 最佳地平衡通用语言建模能力与针对性基准之间的tradeoff。我们还使用域上采样来表征各数据集在 various benchmarks 中的实用性,通过在此训练阶段删除它们来实现此目的。这一工具打开了以规模化方式实验不同预训练数据集影响的能力,但成本降低了一个数量级,相对于完整的预训练运行。

关键词

引用

@article{arxiv.2406.03476,
  title  = {Does your data spark joy? Performance gains from domain upsampling at the end of training},
  author = {Cody Blakeney and Mansheej Paul and Brett W. Larsen and Sean Owen and Jonathan Frankle},
  journal= {arXiv preprint arXiv:2406.03476},
  year   = {2024}
}

备注

The first three authors contributed equally