利用困惑度相关性改进预训练数据
计算与语言
2025-03-11 v2 机器学习
机器学习
摘要
高质量的预训练数据通常被视为高性能语言模型的关键。然而,由于数据选择实验所需的预训练运行成本高昂,对预训练数据的理解进展缓慢。我们提出了一个框架,可以避免这些成本,并在无需我们自己进行任何大语言模型(LLM)训练的情况下选择高质量的预训练数据。我们的工作基于一个简单的观察:许多预训练文本上的 LLM 损失与下游基准性能相关,选择高相关性的文档是一种有效的预训练数据选择方法。我们围绕困惑度-基准相关性估计构建了一个新的统计框架,并使用来自 Open LLM Leaderboard 的 90 个 LLM 样本,在数万个网络域的文本上进行数据选择。在 160M 参数规模、8 个基准上的受控预训练实验中,我们的方法在每个基准上都优于 DSIR,同时匹敌在 DataComp-LM 中发现的最佳数据选择器——一个手工设计的二元分类器。我们现在还更新了本文,纳入了在 22 个基准聚合上使用新预训练数据进行的预注册实验结果,规模高达 1.4B,结果显示我们的方法相对于其他方法随着规模扩大而展现出越来越大的改进。包含完整文档的 pip 包可在此处找到:https://github.com/TristanThrush/perplexity-correlations。
引用
@article{arxiv.2409.05816,
title = {Improving Pretraining Data Using Perplexity Correlations},
author = {Tristan Thrush and Christopher Potts and Tatsunori Hashimoto},
journal= {arXiv preprint arXiv:2409.05816},
year = {2025}
}
备注
ICLR 2025