中文

自适应能力分解:解锁大规模推理模型高效强化学习

计算与语言 2026-02-03 v1 人工智能

摘要

基于可验证奖励的强化学习(RLVR)显示出巨大的潜力,用于提升大型语言模型(LLM)的推理能力。然而,由于在RLVR过程中提供的信息有限,模型只能进行大量盲目探索,常常在具有挑战性的问题上失败。为在不依赖教师模型的情况下为RLVR过程提供额外信息,我们提出了A2^2D方法,即自适应能力分解(Adaptive Ability Decomposing),用于增强RLVR的有效性。具体而言,我们首先通过无蒸馈的方式进行RLVR训练,以训练一个分解器,使其能够将复杂问题分解为一组更简单的子问题。接着,我们使用该分解器为训练数据集中的每个问题标注子问题,然后在具备子问题指导下进行RLVR训练推理器。为更好地理解A2^2D,我们首先与竞争性基线进行比较,显示其有效性。随后,我们观察到该方法是一种即插即用模块,可应用于不同的RLVR算法。此外,我们对分解器进行分析,揭示了RLVR过程如何影响其性能和行为,以及哪种类型的指导更适合增强推理器的探索与开发能力。

关键词

引用

@article{arxiv.2602.00759,
  title  = {Adaptive Ability Decomposing for Unlocking Large Reasoning Model Effective Reinforcement Learning},
  author = {Zhipeng Chen and Xiaobo Qin and Wayne Xin Zhao and Youbin Wu and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2602.00759},
  year   = {2026}
}

备注

21 pages, Working in progress