中文

Big-Math:面向语言模型强化学习的大规模高质量数学数据集

机器学习 2025-02-25 v1 人工智能 计算与语言

摘要

对推理模型日益增长的兴趣使得数学成为算法和方法论改进的重要测试阵地。然而,现有的开放数学数据集要么包含少量高质量、人工编写的问题,要么包含大量质量不确定的机器生成问题,迫使研究者在质量和数量之间做出选择。在这项工作中,我们提出了 Big-Math,一个包含超过 250,000 道具有可验证答案的高质量数学问题的数据集,专为强化学习 (RL) 打造。为了创建 Big-Math,我们严格过滤、清洗和整理了开放可用的数据集,提取满足我们三个期望的问题:(1) 具有唯一可验证解的问题,(2) 开放式问题,(3) 具有闭式解的问题。为确保 Big-Math 的质量,我们人工验证了过滤过程中的每一步。基于过滤过程中的发现,我们引入了 47,000 道带有验证答案的新问题,Big-Math-Reformulated:通过系统重写算法将封闭式问题(即选择题)重写为开放式问题。与最常用的现有开源数学推理数据集 GSM8k 和 MATH 相比,Big-Math 在规模上大了一个数量级,同时我们严格的过滤确保我们保留了最适合 RL 的问题。我们还对数据集进行了严谨的分析,发现 Big-Math 在问题领域上具有高度多样性,并包含广泛的问题难度,能够满足不同能力和训练要求的模型的广泛下游用途。通过弥合数据质量和数量之间的差距,Big-Math 为推进 LLM 的推理能力奠定了坚实基础。

关键词

引用

@article{arxiv.2502.17387,
  title  = {Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models},
  author = {Alon Albalak and Duy Phung and Nathan Lile and Rafael Rafailov and Kanishk Gandhi and Louis Castricato and Anikait Singh and Chase Blagden and Violet Xiang and Dakota Mahan and Nick Haber},
  journal= {arXiv preprint arXiv:2502.17387},
  year   = {2025}
}