中文

DeepMath-103K:一个用于推进推理的大规模、高难度、去污染且可验证的数学数据集

计算与语言 2025-05-26 v2 人工智能

摘要

基于大语言模型的强化学习(RL)在复杂推理任务中展现出良好前景。然而,其进展受限于缺乏足够困难、无污染且可验证的大规模训练数据。为此,我们推出 DeepMath-103K——一个大规模数学数据集,其设计具备高难度(主要为 5–9 级)、针对众多基准的严格去污染,以及用于基于规则的 RL 奖励的可验证答案。该数据集还包含三种不同的 R1 解法,可适配多种训练范式(如监督微调(SFT))。DeepMath-103K 涵盖广泛的数学主题,有助于培养可泛化且不断进步的推理能力。值得注意的是,在 DeepMath-103K 上训练的模型在具有挑战性的数学基准上取得了最先进的结果,并展现出超越数学的泛化能力(如生物、物理和化学),凸显了其广泛的适用性。数据集地址:https://huggingface.co/datasets/zwhe99/DeepMath-103K。

关键词

引用

@article{arxiv.2504.11456,
  title  = {DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning},
  author = {Zhiwei He and Tian Liang and Jiahao Xu and Qiuzhi Liu and Xingyu Chen and Yue Wang and Linfeng Song and Dian Yu and Zhenwen Liang and Wenxuan Wang and Zhuosheng Zhang and Rui Wang and Zhaopeng Tu and Haitao Mi and Dong Yu},
  journal= {arXiv preprint arXiv:2504.11456},
  year   = {2025}
}

备注

WIP