MathPile:一个十亿 token 规模的数学预训练语料库
计算与语言
2024-10-30 v2 人工智能
机器学习
摘要
高质量、大规模的语料库是构建基础模型的基石。在本工作中,我们介绍了 MathPile,这是一个多样化且高质量的以数学为中心的语料库,包含约 95 亿个 token。在其创建过程中,我们遵循“少即是多”的原则,坚信即使在预训练阶段,数据质量也优于数量。我们细致的数据收集和处理工作包括一套复杂的预处理、预过滤、语言识别、清洗、过滤和去重流程,确保了我们语料库的高质量。此外,我们对下游基准测试集进行了数据污染检测以消除重复项,并进行了持续预训练实验,提升了在常见数学推理基准上的性能。我们希望通过 MathPile 提升语言模型的数学推理能力,并开源其不同版本和处理脚本以推动该领域的发展。
引用
@article{arxiv.2312.17120,
title = {MathPile: A Billion-Token-Scale Pretraining Corpus for Math},
author = {Zengzhi Wang and Xuefeng Li and Rui Xia and Pengfei Liu},
journal= {arXiv preprint arXiv:2312.17120},
year = {2024}
}
备注
43 pages. Accepted by NeurIPS 2024. https://github.com/GAIR-NLP/MathPile/