自适应能力分解:解锁大规模推理模型高效强化学习
计算与语言
2026-02-03 v1 人工智能
摘要
基于可验证奖励的强化学习(RLVR)显示出巨大的潜力,用于提升大型语言模型(LLM)的推理能力。然而,由于在RLVR过程中提供的信息有限,模型只能进行大量盲目探索,常常在具有挑战性的问题上失败。为在不依赖教师模型的情况下为RLVR过程提供额外信息,我们提出了AD方法,即自适应能力分解(Adaptive Ability Decomposing),用于增强RLVR的有效性。具体而言,我们首先通过无蒸馈的方式进行RLVR训练,以训练一个分解器,使其能够将复杂问题分解为一组更简单的子问题。接着,我们使用该分解器为训练数据集中的每个问题标注子问题,然后在具备子问题指导下进行RLVR训练推理器。为更好地理解AD,我们首先与竞争性基线进行比较,显示其有效性。随后,我们观察到该方法是一种即插即用模块,可应用于不同的RLVR算法。此外,我们对分解器进行分析,揭示了RLVR过程如何影响其性能和行为,以及哪种类型的指导更适合增强推理器的探索与开发能力。
引用
@article{arxiv.2602.00759,
title = {Adaptive Ability Decomposing for Unlocking Large Reasoning Model Effective Reinforcement Learning},
author = {Zhipeng Chen and Xiaobo Qin and Wayne Xin Zhao and Youbin Wu and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2602.00759},
year = {2026}
}
备注
21 pages, Working in progress