中文

JT-Math:面向大语言模型的高级数学推理的多阶段框架

计算与语言 2025-07-29 v1

摘要

数学推理是人工通用智能的基石,也是评估大语言模型(LLM)能力的主要基准。虽然最先进的模型在某些方面表现出色,但面对需要深层概念理解和复杂多步骤推理的问题时常常失足。为此,我们引入了 JT-Math-8B 系列开源模型,包括基础模型、指令模型和思考模型,基于系统化的多阶段优化框架构建。我们的预训练语料库是一个由专门数据管道筛选的 2100 亿 token 高质量数据集,通过基于模型的验证确保其质量和多样性。指令模型通过监督微调(SFT)和基于 GRPO 的强化学习(RL)方法优化,以提供简洁直接的答案。思考模型采用长链式思考(Long CoT)方法进行复杂问题解决,将 SFT 与一种新型多阶段 RL 课程相结合,该课程逐步增加任务难度和上下文长度,最高达到 32K token。JT-Math-8B 在相似规模的开源模型中实现了最先进成绩,超越了 OpenAI 的 o1-mini 和 GPT-4o,在竞赛级数学题中展现出卓越性能。

关键词

引用

@article{arxiv.2507.19748,
  title  = {JT-Math: A Multi-Stage Framework for Advanced Mathematical Reasoning in Large Language Models},
  author = {Yifan Hao and Fangning Chao and Yaqian Hao and Zhaojun Cui and Huan Bai and Haiyu Zhang and Yankai Liu and Chao Deng and Junlan Feng},
  journal= {arXiv preprint arXiv:2507.19748},
  year   = {2025}
}