中文

面向大型语言模型预训练的数据管理器

计算与语言 2025-04-09 v3 人工智能

摘要

大型语言模型(LLM)的性能涌现受数据规模增长规律驱动,这使得预训练数据的选择日益重要。然而,现有方法依赖有限的启发式和人类直觉,缺乏全面且清晰的指导方针。为此,我们受到“逆向思维”——让LLM自我识别有助于其性能的准则——的启发。由于预训练能力与困惑度(PPL)相关,我们从文本困惑度异常原因出发,导出14项质量准则,并引入15个常见应用领域以支持领域混合。在本文中,我们训练一个数据管理器(DataMan)来从点评学习质量评级和领域识别,并使用其为4470亿标记的预训练语料库标注14项质量评级和领域类型。我们的实验验证了我们的方法,通过DataMan精选300亿标记训练一个13亿参数的语言模型,显著改进了零样本学习(ICL)、困惑度和指令跟随能力,超越最先进的基线。表现最佳的模型基于总体评分l=5,超过了使用50%更多数据进行均匀采样训练的模型。我们继续使用DataMan标注的高质量、领域特定数据进行预训练,以增强领域特定ICL性能,从而验证DataMan的领域混合能力。我们的发现强调了质量排序的重要性、质量准则的互补性,以及其与困惑度之间低相关性,分析了PPL与ICL性能之间的不一致性。我们还彻底分析了预训练数据集,检查了其组成、质量评级分布以及原始文档来源。

关键词

引用

@article{arxiv.2502.19363,
  title  = {DataMan: Data Manager for Pre-training Large Language Models},
  author = {Ru Peng and Kexin Yang and Yawen Zeng and Junyang Lin and Dayiheng Liu and Junbo Zhao},
  journal= {arXiv preprint arXiv:2502.19363},
  year   = {2025}
}

备注

ICLR2025 paper