中文

RL-PLUS:基于混合策略优化对抗 LLM 在强化学习中的能力边界崩溃

人工智能 2026-04-16 v5 计算与语言 机器学习

摘要

基于可验证奖励的强化学习(RLVR)已显著提升了大语言模型(LLM)的复杂推理能力。然而,它因本质上的基于策略方法以及 LLM 庞大的动作空间和稀疏奖励,难以突破底层 LLM 的固有能力边界。关键问题是,RLVR 可能导致能力边界崩溃,缩小 LLM 的问题解决范围。为此,我们提出了 RL-PLUS,这是一种 novel 混合策略优化方法,用于 LLM,通过融合内部探索与外部数据,实现更强的推理能力并超越基础模型的边界。RL-PLUS 集成了两个核心组件,即多重重要抽样用于解决来自外部数据的分布不匹配,以及基于探索的优势函数以引导模型前往高价值、未探索的推理路径。我们提供了理论分析和大量实验,展示了该方法的优越性和通用性。与现有 RLVR 方法相比,RL-PLUS 实现了:1)在六个数学推理基准测试中实现最新性能;2)在六个跨分布推理任务中表现优异;3)在 diverse 模型家族中保持一致且显著的提升,平均相对提升最高达69.2%。此外,Pass@k 曲线的分析表明,RL-PLUS 有效解决了能力边界崩溃问题。

关键词

引用

@article{arxiv.2508.00222,
  title  = {RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization},
  author = {Yihong Dong and Xue Jiang and Yongding Tao and Huanyu Liu and Kechi Zhang and Lili Mou and Rongyu Cao and Yingwei Ma and Jue Chen and Binhua Li and Zhi Jin and Fei Huang and Yongbin Li and Ge Li},
  journal= {arXiv preprint arXiv:2508.00222},
  year   = {2026}
}

备注

Accepted to ACL 2026 (main)