rStar-Math:小型大语言模型通过自演化深层思考掌握数学推理
计算与语言
2025-01-09 v1
摘要
我们提出了 rStar-Math 以展示小型语言模型 (SLM) 能够与甚至超越 OpenAI o1 的数学推理能力,而无需从更优秀的模型进行蒸馏。rStar-Math 通过蒙特卡洦树搜索 (MCTS) 进行“深度思考”,其中数学策略 SLM 通过基于 SLM 的过程奖励模型进行测试时搜索,以实现此目标。rStar-Math 针对训练两个 SLM 面临的挑战,引入了三项创新:(1) 一种新的代码增强的思维链数据合成方法,通过进行大量 MCTS 随机滚动生成逐步验证的推理轨迹,用于训练策略 SLM;(2) 一种新的过程奖励模型训练方法,避免简单的人类在每一步级别的评分注释,生成更有效的过程偏好模型 (PPM);(3) 一种自演化配方,其中策略 SLM 和 PPM 从零开始构建并迭代演化以提升推理能力。通过 4 轮自演化,针对 747k 个数学问题进行数百万合成解答,rStar-Math 将 SLM 的数学推理提升至最先进水平。在 MATH 数据集上,将 Qwen2.5-Math-7B 从 58.8% 提升至 90.0%,将 Phi3-mini-3.8B 从 41.4% 提升至 86.4%,超越 o1-preview 高出 +4.5% 和 +0.9%。在美国数学奥林匹克 (AIME),rStar-Math 在平均 53.3% (8/15) 的问题中取得好成绩,位于顶尖 20% 的高中生数学水平之上。代码和数据将在 https://github.com/microsoft/rStar 提供。
引用
@article{arxiv.2501.04519,
title = {rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking},
author = {Xinyu Guan and Li Lyna Zhang and Yifei Liu and Ning Shang and Youran Sun and Yi Zhu and Fan Yang and Mao Yang},
journal= {arXiv preprint arXiv:2501.04519},
year = {2025}
}