中文

通过多样化文件选择消除 LLM 预训练中的维度坍缩

机器学习 2025-04-30 v1

摘要

选择高质量的预训练数据对于在有限计算预算下提升大型语言模型(LLM)的整体性能至关重要,能够提升训练和样本效率。最近的文档选择方法主要依赖于使用现有的或训练好的代理模型来评估样本与目标领域的相似性,例如高质量来源 BookCorpus 和 Wikipedia。然而, upon revisiting these methods, 领域相似性选择标准显示出一种多样性困境,即特征空间中的维度坍缩,在与域相关任务上提升性能,但在通用性能上造成严重退化。为防止坍缩并增强多样性,我们提出了一种 DiverSified File selection algorithm(DiSF),该算法在特征空间中选择最不相关的文本文件。我们采用经典的贪心算法以实现特征协方差矩阵中所选文本的特征值更均匀,分析其在 γ\gamma-弱亚模ular optimization problem 的形式下对最优解的近似。经验上,我们建立了一个基准并在 TinyLlama 架构上进行大量实验,参数规模从 1.2 亿到 11 亿不等。在 Harness 框架下的九个任务上,DiSF 在整体性能方面显著优于全量数据预训练。具体而言,DiSF 在 SlimPajama 中的 5900 万训练文件中节省 98.5%,在 500 亿训练预算内实现了与全量数据相当的性能,并实现约 1.5 倍的训练效率和 5 倍的数据效率。

关键词

引用

@article{arxiv.2504.20644,
  title  = {Combatting Dimensional Collapse in LLM Pre-Training Data via Diversified File Selection},
  author = {Ziqing Fan and Siyuan Du and Shengchao Hu and Pingjie Wang and Li Shen and Ya Zhang and Dacheng Tao and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2504.20644},
  year   = {2025}
}