面向大语言模型预训练的数学数据选择框架 MASS
计算与语言
2025-07-08 v2 人工智能
摘要
高质量数据在大语言模型(LLM)的预训练和微调中发挥关键作用,甚至决定了其性能上限。因此,大量数据选择方法被提出,以识别有效且高效提升模型性能的数据子集。然而,这些方法大多关注通用数据选择,往往忽视领域相关数据的特定细微差别。本文引入 MASS,即利用技能图进行数学数据选择框架,以适用于大语言模型的数学推理领域。我们考虑数学与推理的独特特征,构建捕获数学技能及其相互关系的技能图。该技能图指导我们为目标数据集赋予质量评分,从而选择排名靠前的子集用于预训练大语言模型。实验结果表明,MASS 在不同模型规模(1B 和 7B)和预训练数据集(网络数据和合成数据)方面均具备效率与效果。具体而言,在效率方面,采用 MASS 选择的数据子集训练的模型,可实现与原始数据集训练的模型相当的性能,但训练标记数目减少约 50%至 70%。在效果方面,采用 MASS 选择的数据在相同训练标记数下,优于原始数据集训练的模型 3.3%至 5.9%。这些结果凸显了 MASS 在提升大语言模型预训练效率与效果方面的潜力。
引用
@article{arxiv.2503.14917,
title = {MASS: Mathematical Data Selection via Skill Graphs for Pretraining Large Language Models},
author = {Jiazheng Li and Lu Yu and Qing Cui and Zhiqiang Zhang and Jun Zhou and Yanfang Ye and Chuxu Zhang},
journal= {arXiv preprint arXiv:2503.14917},
year = {2025}
}