中文

RefineX:从专家导向程序大规模学习预训练数据的细化

计算与语言 2025-07-10 v2 人工智能

摘要

大型语言模型(LLM)的基础能力深受其预训练语料质量的影响。然而,如何在规模化的前提下提升数据质量 remains 一个重大挑战,主要由于细化效果与处理效率之间的权衡。虽然基于规则的过滤方法仍是主流范式,但通常仅在文档级别运行,缺乏针对文档内部特定内容进行细化的细粒度能力。鼓舞于诸如 ProX 等新兴工作,我们提出了一种名为 RefineX 的新型框架,用于通过程序化编辑任务对预训练数据进行大规模、精准的细化。RefineX 能够在可靠地保持语料多样性和自然性的前提下,实现高效的细粒度数据细化。RefineX 的核心优势在于将高质量、由专家指导的端到端细化结果提炼为最小化的基于编辑的删除程序。这一高精度提炼管道用于训练高效可靠的细化模型,可在规模化程度上系统性地改进语料库中的每个实例。我们在多个模型规模上进行从零开始的预训练评估,发现其在 diverse downstream tasks 上 consistently outperform 基于原始、过滤或替代性细化数据训练的模型。在 750M 参数模型上,RefineX 在 lighteval tasks 上实现了 2.6%-7.2% 的平均提升,并显著减少了训练标记数。进一步分析表明,RefineX 在保持高效率和高精度的同时可靠地提升文本质量,超越了基于端到端生成和 Prox-C 的先前方法。这些结果将 RefineX 定位为现代 LLM 管道中优化预训练数据的可扩展、有效且可靠解决方案。

关键词

引用

@article{arxiv.2507.03253,
  title  = {RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs},
  author = {Baolong Bi and Shenghua Liu and Xingzhang Ren and Dayiheng Liu and Junyang Lin and Yiwei Wang and Lingrui Mei and Junfeng Fang and Jiafeng Guo and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2507.03253},
  year   = {2025}
}