中文

将 GPT-4o 作为语言模型预训练数据过滤的黄金标准:一种可扩展且通用的方法

计算与语言 2025-02-03 v3 机器学习

摘要

大型语言模型需要大量高质量训练数据,但对网络规模数据集的有效筛选仍然是一个重大挑战。本文展示了 GPT-4o 在识别高质量训练数据方面效果极佳,但其高昂的成本使得在网络规模下实际操作不可行。我们提出了 SIEVE,这是一个轻量级替代方案,在成本不足 GPT-4o 的 1% 时能够匹配其准确率。SIEVE 每调用一次 GPT-4o 过滤功能,最多可进行 500 次筛选操作。SIEVE 的关键在于将 GPT-4o 与轻量级文本分类模型无缝集成,利用主动学习技术在少量调用 GPT-4o 的情况下对这些模型进行背景微调。训练完成后,它在成本的极小比例下即可达到与 GPT-4o 相当的性能。通过不同的过滤提示,SIEVE 可以高效地从网络规模语料库中筛选出通用领域或特定领域的高质量数据——这正是当前稀缺的高质量领域特定数据集所需的宝贵能力。使用自动评估和人类评估指标进行大量实验表明,SIEVE 与 GPT-4o 在五个高度特定的过滤提示下取得相似的性能。此外,在对网络爬虫数据集进行质量过滤时,我们展示了 SIEVE 在 DataComp-LM 挑战中用于选择 LLM 预训练数据的质量过滤方法方面能够进一步超越当前最先进的技术。

关键词

引用

@article{arxiv.2410.02755,
  title  = {GPT-4o as the Gold Standard: A Scalable and General Purpose Approach to Filter Language Model Pretraining Data},
  author = {Jifan Zhang and Ziyue Luo and Jia Liu and Ness Shroff and Robert Nowak},
  journal= {arXiv preprint arXiv:2410.02755},
  year   = {2025}
}