中文

FIRE:面向高效预训练的数据质量评分灵活集成框架

计算与语言 2025-05-23 v3

摘要

选择高质量数据可以提升大语言模型(LLMs)的预训练效率。现有方法通常依赖启发式技术或单一质量信号,限制了其全面评估数据质量的能力。本文提出FIRE,一个灵活且可扩展的框架,用于集成多个数据质量评分器,从而能够从多个维度对数据质量进行全面评估。FIRE将多个质量信号对齐到一个统一空间,并整合多样化的数据质量评分器,为每个数据点提供综合质量信号。此外,我们引入了一种基于FIRE的渐进式数据选择方案,该方案迭代地优化高质量数据点的选择。大量实验表明,FIRE优于其他数据选择方法,并显著提升了预训练模型在广泛下游任务中的性能,同时仅需随机基线所需训练数据的37.5%以下即可达到目标性能。

关键词

引用

@article{arxiv.2502.00761,
  title  = {FIRE: Flexible Integration of Data Quality Ratings for Effective Pre-Training},
  author = {Liangyu Xu and Xuemiao Zhang and Feiyu Duan and Sirui Wang and Rongxiang Weng and Jingang Wang and Xunliang Cai},
  journal= {arXiv preprint arXiv:2502.00761},
  year   = {2025}
}

备注

21 pages, 11 figures