中文

DataDecide:如何通过小型实验预测最佳预训练数据

机器学习 2025-07-15 v2 计算与语言

摘要

由于在不同数据集上预训练大型语言模型代价高昂,因此利用较小规模的实验来决定数据选择对于降低成本至关重要。哪些基准以及基于小规模观测性能进行决策的方法,能够最准确地预测出能产出最佳大模型的数据集?为推动对该问题的开放探索,我们发布了 DataDecide 中的模型、数据与评测——这是目前规模最大的、涵盖数据与规模差异的开源模型套件。我们在 25 个语料库上进行了受控的预训练实验,这些语料库在来源、去重与过滤方面各不相同,数据规模最高达 100B tokens,模型规模最高达 1B 参数,并使用 3 个随机种子。我们发现,在单一小规模(例如 150M 参数)下的模型排序,是预测更大目标规模(1B)下最佳模型的强有力基线(约 80% 的比较正确)。在 8 种基线方法中,没有任何一种标度律方法能够超越单规模预测的计算-决策前沿,但 DataDecide 能够衡量未来标度律的改进。我们还发现,在小型实验中使用连续似然指标作为代理指标,可以使包括 MMLU、ARC、HellaSwag、MBPP 和 HumanEval 在内的基准在目标 1B 规模下以仅 0.01% 的计算量实现超过 80% 的可预测性。

关键词

引用

@article{arxiv.2504.11393,
  title  = {DataDecide: How to Predict Best Pretraining Data with Small Experiments},
  author = {Ian Magnusson and Nguyen Tai and Ben Bogin and David Heineman and Jena D. Hwang and Luca Soldaini and Akshita Bhagia and Jiacheng Liu and Dirk Groeneveld and Oyvind Tafjord and Noah A. Smith and Pang Wei Koh and Jesse Dodge},
  journal= {arXiv preprint arXiv:2504.11393},
  year   = {2025}
}

备注

ICML 2025