中文

通过问题扩充提升大语言模型推理能力的 QuestA 方法

计算与语言 2026-04-01 v4 人工智能

摘要

强化学习(RL)已成为训练大型语言模型(LLM)进行推理任务的核心范式。然而,近期研究质疑 RL 在激发基础模型之外推理能力的能力。这引出一个关键挑战:如何能够更有效地适应 RL 以解决更难的推理问题?为此,我们提出了一种简单且有效的策略,即问题扩充:在训练期间引入部分解决方案以降低问题难度并提供更有信息的学习信号。我们的方法 QuestA 应用于 RL 训练中的数学推理任务,不仅提升了 pass@1 效果,还提升了 pass@k 效果——尤其是在标准 RL 难以取得进展的问题上。这使得该方法能够持续改进强大的开源模型,如 DeepScaleR 和 OpenMath Nemotron,进一步增强其推理能力。我们使用 15B 参数模型实现了在数学基准测试上的新纪录成绩:AIME24 达到 72.50%(提升 10.73%),AIME25 达到 62.29%(提升 12.79%),HMMT25 达到 41.67%(提升 10.11%)。代码、数据和模型均可在 https://github.com/foreverlasting1202/QuestA 查阅。

关键词

引用

@article{arxiv.2507.13266,
  title  = {QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation},
  author = {Jiazheng Li and Hongzhou Lin and Hong Lu and Kaiyue Wen and Zaiwen Yang and Jiaxuan Gao and Yi Wu and Jingzhao Zhang},
  journal= {arXiv preprint arXiv:2507.13266},
  year   = {2026}
}

备注

25 pages, 18 figures, ICLR 2026