自适应揭示论证路径的强化学习推理
机器学习
2026-03-03 v2 人工智能
摘要
序列生成问题的巨大输出空间使得学习具有挑战性,因为专家演示随序列长度而扩展性差,强化学习在稀疏奖励方面也困难。我们探讨了介于监督训练中密集演示与强化学习中无演示之间的未被充分探索的范畴:部分监督。我们询问某些序列学习问题是否可以通过利用这一差距变得有效可学习。我们通过引入自适应后退(AdaBack)——一种为每个样本动态揭示目标输出部分前缀的课程学习算法来解决这一问题。监督长度根据模型过去的奖励信号动态调整,从而允许其通过以条件化正确的部分解决方案来逐步学习完成推理链。我们研究了SFT与RL之间的这一中间范畴,认为按样本的课程学习不仅是效率与普遍性之间的权衡——它可以在序列长度为长且存在潜在依赖关系的任务中成功,其中SFT和RL都无法泛化。使用带有潜在奇偶约束的合成任务,我们发现AdaBack可靠地解决了其他情况下难以解决的问题。在三个数学推理基准测试中,DeepScaleR、MATH和GSM8k,我们发现AdaBack使得模型能够解决RL单独无法解决的问题,通过逐渐暴露于部分解决方案来获取新的推理能力。
引用
@article{arxiv.2506.18110,
title = {RL for Reasoning by Adaptively Revealing Rationales},
author = {Mohammad Hossein Amani and Aryo Lotfi and Nicolas Mario Baldwin and Samy Bengio and Mehrdad Farajtabar and Emmanuel Abbe and Robert West},
journal= {arXiv preprint arXiv:2506.18110},
year = {2026}
}
备注
22 pages, 11 figures