中文

难度感知的分阶段强化学习如何提升大语言模型的推理能力:初步实验研究

计算与语言 2025-04-02 v1

摘要

以提高大型语言模型(LLM)的推理能力兼顾效率和可扩展性,是人工智能研究中的一项基本挑战。本文对如何通过难度感知的分阶段强化学习(RL)策略显著性地提升LLM推理性能开展严谨的实验探究。通过系统性分析,我们展示,根据明确定义的难度水平策略性地选择训练数据对RL优化具有显著提升作用。此外,我们引入一种分阶段训练方法,逐步将模型暴露于日益具备挑战性的任务中,从而进一步放大推理能力。我们的发现表明,在同时进行数学推理和代码生成任务训练时,能够获得显著的跨领域益处。值得注意的是,我们提出的方法使15亿参数模型在AIME-2024基准测试上达到42.3%的准确率,在MATH-500基准测试上达到89.5%的准确率。这些结果凸显了该方法在推动LLM推理水平方面的有效性。我们将在GitHub和Hugging Face上开源数据集。

关键词

引用

@article{arxiv.2504.00829,
  title  = {How Difficulty-Aware Staged Reinforcement Learning Enhances LLMs' Reasoning Capabilities: A Preliminary Experimental Study},
  author = {Yunjie Ji and Sitong Zhao and Xiaoyu Tian and Haotian Wang and Shuaiting Chen and Yiping Peng and Han Zhao and Xiangang Li},
  journal= {arXiv preprint arXiv:2504.00829},
  year   = {2025}
}