中文

Nemotron-CC-Math:一个1330亿token规模的高质量数学预训练数据集

计算与语言 2025-08-22 v1 人工智能 机器学习

摘要

在数学和代码等高质量、结构化数据上预训练大型语言模型能显著增强推理能力。然而,现有基于Common Crawl构建的数学数据集因脆弱的提取启发式方法、有损的HTML到文本转换以及无法可靠保留数学结构而导致质量下降。在这项工作中,我们引入了Nemotron-CC-Math,一个大规模、高质量的数学语料库,它使用一种新颖的、领域无关的流程从Common Crawl构建,该流程专为鲁棒的科学文本提取而设计。与以往工作不同,我们的流程通过利用基于布局感知的渲染和针对性的基于大型语言模型的清理阶段,恢复了各种格式(如MathJax、KaTeX、MathML)的数学内容。这种方法保留了方程和代码块的结构完整性,同时移除了样板内容,将符号标准化为LaTeX表示,并纠正了不一致之处。我们收集了一个大型、高质量的数学语料库,即Nemotron-CC-Math-3+(1330亿token)和Nemotron-CC-Math-4+(520亿token)。值得注意的是,Nemotron-CC-Math-4+不仅超越了所有先前的开放数学数据集——包括MegaMath、FineMath和OpenWebMath——而且其token数量是FineMath-4+的5.5倍,后者此前是最高质量的数学预训练数据集。当用于预训练Nemotron-T 8B模型时,我们的语料库在MATH上带来了+4.8到+12.6的提升,在MBPP+上带来了+4.6到+14.3的提升,同时还在MMLU和MMLU-Stem上提升了通用领域性能。我们提出了首个从嘈杂的网络规模数据中可靠提取科学内容(包括数学)的流程,在数学、代码和通用推理方面带来了可衡量的增益,并在开放数学预训练语料库中设立了新的最先进水平。为支持开源工作,我们发布了代码和数据集。

关键词

引用

@article{arxiv.2508.15096,
  title  = {Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset},
  author = {Rabeeh Karimi Mahabadi and Sanjeev Satheesh and Shrimai Prabhumoye and Mostofa Patwary and Mohammad Shoeybi and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2508.15096},
  year   = {2025}
}