中文

面向高效预训练的组级数据选择

计算与语言 2025-06-23 v2 机器学习

摘要

本文提出 Group-MATES,一种高效的组级数据选择方法,以优化语言模型预训练的速度与性能平衡。具体而言,Group-MATES 使用关系数据影响模型对昂贵的组级选择进行参数化。为训练该模型,我们抽样语言模型的训练轨迹,并收集 oracle 数据影响。关系数据影响模型通过对训练数据中的 individual influence 加权来近似 oracle 数据影响。为实现与关系数据影响模型的高效选择,我们将数据集划分为小型簇,并基于关系权重进行聚类,对每个簇内的数据独立进行选择。在 DCLM 400M-4x、1B-1x 和 3B-1x 上的实验表明,Group-MATES 在 22 个下游任务上相对于随机选择实现 3.5%-9.4% 的相对性能提升,几乎翻倍了最先进的 individual 数据选择基线的提升幅度。此外,Group-MATES 将达到特定下游性能所需的标记数最多降低 1.75 倍,显著提升速度-性能前沿。进一步分析凸显了关系权重在关系数据影响模型中的关键作用以及基于簇的推断有效性。Our 代码已开源于 https://github.com/facebookresearch/Group-MATES。

关键词

引用

@article{arxiv.2502.14709,
  title  = {Group-Level Data Selection for Efficient Pretraining},
  author = {Zichun Yu and Fei Peng and Jie Lei and Arnold Overwijk and Wen-tau Yih and Chenyan Xiong},
  journal= {arXiv preprint arXiv:2502.14709},
  year   = {2025}
}