打破探索瓶颈:基于评分指引的强化学习通用 LLM 推理
机器学习
2026-02-02 v6 人工智能
摘要
最近的大语言模型 (LLM) 进展凸显了利用强化学习 (RL) 来促进推理能力涌现的潜力。尽管已取得鼓舞人心的成果,但仍存在根本性困境:RL 改进依赖于高质量样本的学习,而探索受限于 LLM 本身的局限性。这形成了一种令人不快的循环:无法探索的部分无法被学习。在本文中,我们提出一种称为 Rubric-Scaffolded Reinforcement Learning (RuscaRL) 的新型指令性支架框架,以打破 LLM 推理的探索瓶颈。具体而言,RuscaRL 引入基于清单的评分指引作为 (1) 推理生成期间的显式支架,在任务指令中提供不同的评分指引以引导多样化的高质量响应。这种指引随时间逐渐减弱,以鼓励模型内化底层推理模式;(2) 模型训练期间用于利用评分指引获取可靠的 LLM-as-a-Judge 分数的可验证奖励,使我们能够在一般推理任务上实现有效的 RL。广泛实验表明,所提出的 RuscaRL 在各种基准测试中均显示优越性,有效在 Best-of-N 评估下扩展了推理边界。我们的代码已公开于 https://github.com/IANNXANG/RuscaRL。
引用
@article{arxiv.2508.16949,
title = {Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning},
author = {Yang Zhou and Sunzhu Li and Shunyu Liu and Wenkai Fang and Kongcheng Zhang and Jiale Zhao and Jingwen Yang and Yihe Zhou and Jianwei Lv and Tongya Zheng and Hengtong Lu and Wei Chen and Yan Xie and Mingli Song},
journal= {arXiv preprint arXiv:2508.16949},
year = {2026}
}