强化学习能否教授大语言模型长程推理?表达能力是关键
人工智能
2026-05-19 v3 计算与语言
摘要
强化学习 (RL) 已被应用于提升大语言模型 (LLM) 的推理能力,但由于缺乏可控且可扩展的环境,对训练如何随任务难度进行扩展的系统研究受到了阻碍。观察到的 LLM 在长程推理中的缺陷引发了这样一种可能性:这些缺陷是自回归 Transformer 架构固有的。为了解决这个问题,我们引入了 ScaleLogic,一个合成逻辑推理框架,它对难度的两个维度提供独立控制:所需证明规划的深度(即视界)和底层逻辑的表达能力。我们提出的框架支持广泛的逻辑:从简单的仅蕴含逻辑(“若-则”)到更具表达能力的带有合取(“与”)、析取(“或”)、否定(“非”)和全称量化(“对所有”)的一阶推理。使用该框架,我们表明 RL 训练计算量 随推理深度 呈幂律关系(,),并且缩放指数 随逻辑表达能力单调递增,从 增至 。在下游数学和通用推理基准上,更具表达能力的训练设置比较低表达能力的设置产生更大的性能提升(高达 分)且计算效率更高的迁移,这表明模型的训练内容而不仅仅是训练量塑造了下游迁移。我们进一步表明,幂律关系在多种 RL 方法中均成立,并且基于课程的训练显著提高了缩放效率。更广泛地说,我们的结果表明,LLM 在长程推理中的缺陷并非底层架构所固有,可以通过改进训练方法和数据来解决。
引用
@article{arxiv.2605.06638,
title = {Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key},
author = {Tianle Wang and Zhaoyang Wang and Guangchen Lan and Xinpeng Wei and Sipeng Zhang and Guanwen Qiu and Abulhair Saparov},
journal= {arXiv preprint arXiv:2605.06638},
year = {2026}
}