拉升LLM推理边界
机器学习
2026-02-11 v2 计算与语言
摘要
当前在线强化学习(RL)算法如GRPO在LLM推理方面存在一个关键局限:它们无法从“无法解决”的问题中学习。换句话说,它们只能在模型能够探索正确答案的问题上提高性能。因此,模型的“上限”在RL训练后保持不变,尽管解决更容易、可解问题的可能性可能会增加。这些硬样本无法贡献训练,因为没有rollout产生奖励,因而没有梯度被产生。为从这些硬样本中学习,我们提出了NuRL方法,旨�通过自生成提示推动LLM推理的上限,即帮助降低模型解决问题难度的抽象线索。给定问题和其黄金答案,模型生成推理链(CoT),然后产生包含解决该问题所需核心知识的提示。在训练期间,我们生成G个从基础策略的rollout,并根据通过率决定提示是否应被注入。对于通过率为0%的硬样本,我们注入提示并重新生成一批轨迹。这带来了两个好处:(1)提示提高了通过率(从0%提高到非零),从而为先前不可解决的样本引入训练信号;(2)提示是自生成的,避免了分布迁移,不依赖外部模型。NuRL在6个基准测试和3个模型上实现了持续的改进,同时保持与测试时间扩展的互补性。值得注意的是,NuRL能够提升模型的上限,而GRPO则使pass@1024保持不变。此外,我们进行了一项系统性研究,探讨何种提示最有效,以及何时最有用。有趣的是,最佳提示是抽象的和高层次的,当提示必需且在GRPO收敛后最有益时,效果最佳。
引用
@article{arxiv.2509.25666,
title = {Nudging the Boundaries of LLM Reasoning},
author = {Justin Chih-Yao Chen and Becky Xiangyu Peng and Prafulla Kumar Choubey and Kung-Hsiang Huang and Jiaxin Zhang and Mohit Bansal and Chien-Sheng Wu},
journal= {arXiv preprint arXiv:2509.25666},
year = {2026}
}
备注
ICLR 2026 (Camera-Ready)