基于选择器引导的自适应课程:面向可验证奖励的单次强化学习
机器学习
2026-05-05 v1 人工智能
摘要
最近,基于可验证奖励的强化学习(Reinforcement Learning from Verifiable Rewards, RLVR)已被证明是一种高效提升大型语言模型(LLM)数学推理能力的技术,仅需单个实例。当前最先进的 1 次 RLVR 模型采用基于历史奖励方差的启发式方法选择实例,我们发现其作为迁移价值度量本身存在固有的误导性。在本文中,我们提出了一种选择器引导的自适应课程(Selector-Guided Autonomous Curriculum, SGAC)方法,采用可学习的选择器模型,基于成功概率、奖励方差、输出不一致性(熵)和语义难度水平等多维特征空间,而非静态奖励方差启发式。在我们对候选问题池进行经验评估后发现,输出不一致性而非奖励方差是推理后续迭代增益的最强预测器。基于这一发现,我们开发了一种自主课程算法,用于动态从大型问题池中筛选候选问题,按学习型选择器对其进行排序,并运行微型突发的 1 次 GRPO。我们的框架使用 Hendrycks MATH 基准进行评估,Qwen2.5-Math-1.5B 模型作为基线。我们的框架在 hold-out 数据集上获得了 68.0% 的准确率,这超过了当前最先进模型的 64.0% 准确率,以及 Wang 等人提出的 1 次 RLVR 检查点获得的 66.0% 准确率。结果表明,基于熵的智能数据精选在数据极度有限的情况下,优于静态训练方法,实现了严格的推理改进。
引用
@article{arxiv.2605.01823,
title = {Selector-Guided Autonomous Curriculum for One-Shot Reinforcement Learning from Verifiable Rewards},
author = {Rudray Dave and Vedang Dubey and Smit Deoghare and Sudhakar Mishra},
journal= {arXiv preprint arXiv:2605.01823},
year = {2026}
}