Meta-rater:面向预训练语言模型的多维数据选择方法
计算与语言
2025-08-07 v4
摘要
大型语言模型(LLM)的预训练数据集构成目前仍基本不为人所知,这妨碍了透明度和优化数据质量的努力——数据质量是模型性能的关键驱动力。当前的数据选择方法,如自然语言质量评估、基于多样性的过滤器和基于分类器的方法,受限于单维度评估或以冗余为导向的策略。为此,我们提出了四个维度来评估数据质量:专业性、可读性、推理能力和干净度。我们进一步引入 Meta-rater,一种将这些维度与现有质量指标结合 through learned optimal weightings 的多维数据选择方法。Meta-rater 使用代理模型训练回归模型,以预测验证损失,从而识别质量分数的最优组合。实验表明,Meta-rater 能将 13 亿参数模型的收敛速度翻倍,并提升下游任务性能 3.23,规模优势可扩展至 72 亿参数模型。我们的工作表明,整合多维质量显著优于传统单维度方法,为提高预训练效率和模型能力提供了可扩展的范式。为推进未来研究,我们将在 https://github.com/opendatalab/Meta-rater 上发布脚本、数据和模型。
引用
@article{arxiv.2504.14194,
title = {Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models},
author = {Xinlin Zhuang and Jiahui Peng and Ren Ma and Yinfan Wang and Tianyi Bai and Xingjian Wei and Jiantao Qiu and Chi Zhang and Ying Qian and Conghui He},
journal= {arXiv preprint arXiv:2504.14194},
year = {2025}
}
备注
ACL 2025 Best Theme Paper Award