Nemotron-CLIMB:基于聚类的迭代数据混合引导的语言模型预训练
计算与语言
2025-12-02 v2
摘要
预训练数据集通常来自网络内容,缺乏内在的领域划分。例如,广泛使用的Common Crawl不包含明确的领域标签,而手动精选的带标签数据集(如The Pile)则需要大量人力。因此,在预训练中识别最佳数据混合方案仍是一个具有挑战性且对预训练性能具有重要影响的问题。为此,我们提出CLIMB(Clustering-based Iterative Data Mixture Bootstrapping),一种自动框架,用于在预训练设置中发现、评估和细化数据混合方案。具体而言,Nemotron-CLIMB将大规模数据集在语义空间中嵌入并聚类,然后通过较小的代理模型和预测器进行迭代搜索,以寻找最佳混合方案。在持续使用该混合方案训练4000亿标记的模型后,我们的10亿参数模型超过了最新的Llama-3.2-1B提升了2.0%。此外,我们观察到针对特定领域(例如社会科学)进行优化比随机抽样提高了5%。最后,我们引入Nemotron-ClimbLab,一个包含20个聚类的1.2万亿标记语料库作为研究试验场所,以及Nemotron-ClimbMix,一个紧凑且强大的4000亿标记数据集,旨在高效预训练,能在相同标记预算下提供卓越性能。我们分析最终的数据混合方案,阐明了最佳数据混合方案的特征。我们的数据可在:https://research.nvidia.com/labs/lpr/climb/ 获取。
引用
@article{arxiv.2504.13161,
title = {Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training},
author = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Yingyan and Lin and Jan Kautz and Pavlo Molchanov},
journal= {arXiv preprint arXiv:2504.13161},
year = {2025}
}
备注
Accepted to NeurIPS 2025