基于 LLM 的逐行过滤:细化 Web 数据 - FinerWeb-10BT
计算与语言
2025-01-14 v1
摘要
数据质量是训练大型语言模型 (LLM) 的关键因素。传统的启发式过滤方法常常遗漏低质量文本,或误删有价值的内容。本文引入一种基于 LLM 的逐行过滤方法,以提高训练数据质量。我们使用 GPT-4o mini 对 FineWeb 中 20,000 篇文档的样本进行逐行标注,使模型能够为低质量行创建描述性标签。这些标签分为九个主要类别,我们训练一个 DeBERTa-v3 分类器,将过滤扩展到 FineWeb 的 100 亿 token 子集。为了测试我们的过滤效果,我们在原始数据集和过滤后的数据集上训练 GPT-2 模型。结果表明,训练过滤后数据集的模型在 HellaSwag 基准测试上获得更高的准确率,且以更快的速度达到性能目标,即便使用最多 25% 更少的数据也能实现。这表明基于 LLM 的逐行过滤显著提高了数据质量和训练效率。我们发布了质量标注数据集 FinerWeb-10BT 以及代码基地,以支持该领域的进一步研究。
引用
@article{arxiv.2501.07314,
title = {FinerWeb-10BT: Refining Web Data with LLM-Based Line-Level Filtering},
author = {Erik Henriksson and Otto Tarkka and Filip Ginter},
journal= {arXiv preprint arXiv:2501.07314},
year = {2025}
}
备注
11 pages, 4 figures, 4 tables. To be published in NoDaLiDa/Baltic-HLT 2025 proceedings