探索基于结果奖励的数学推理学习极限
计算与语言
2025-02-11 v1 机器学习
摘要
推理能力,尤其是解决复杂数学问题的能力,是通用智能的关键组成部分。近期,诸如 OpenAI 的 o 系列模型等专有公司取得的进展在推理任务上取得了显著成果。然而,完整的技术细节仍未公开,被认为一定采用的技术仅是强化学习(RL)和长链思考。本文提出了一种新的强化学习框架,称为 OREAL,用以追求基于结果奖励(Outcome REward-based reinforcement Learning)的数学推理任务所能达到的性能极限,此时仅需易于获取的二元结果奖励。我们在理论上证明,行为克隆来自基于最佳-N (BoN) 采样的正轨迹,足以在二元反馈环境中学习 KL 正则化的最优策略。该表述进一步暗示,负样本的奖励应被重塑,以确保正负样本之间的梯度一致性。为缓解稀疏奖励在 RL 中带来的长期困难,这些困难在推理任务的长链思考的部分正确性问题中尤为突出,我们进一步应用基于 token 级别的奖励模型,以对推理轨迹中的重要 token 进行采样以进行学习。通过 OREAL,首次实现 7B 模型在 MATH-500 上的 94.0% pass@1 准确率,与 32B 模型持平。OREAL-32B 还在 MATH-500 上通过蒸馏训练的先前 32B 模型中取得了 95.0% pass@1 准确率。我们的研究还表明,初始策略模型和训练查询对 RL 的重要性。代码、模型和数据将发布以利于未来研究\footnote{https://github.com/InternLM/OREAL}。
引用
@article{arxiv.2502.06781,
title = {Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning},
author = {Chengqi Lyu and Songyang Gao and Yuzhe Gu and Wenwei Zhang and Jianfei Gao and Kuikun Liu and Ziyi Wang and Shuaibin Li and Qian Zhao and Haian Huang and Weihan Cao and Jiangning Liu and Hongwei Liu and Junnan Liu and Songyang Zhang and Dahua Lin and Kai Chen},
journal= {arXiv preprint arXiv:2502.06781},
year = {2025}
}
备注
We released our code, data, and model on https://github.com/InternLM/OREAL