当自我信念误导时:基于可验证奖励的强化学习主动标签获取
机器学习
2026-05-26 v1 计算与语言
摘要
大型语言模型(LLM)在由可验证奖励驱动的强化学习(RLVR)中取得了显著推理能力的进展。然而,RLVR 本质上依赖于用于奖励计算的真实标签,而获取这些标签在现实场景中往往成本高昂。虽然无监督 RLVR 范式尝试通过伪标签训练来规避这一问题,但却极易引发训练崩溃。此外,不同样本往往具有不同的标注价值。本文提出基于可验证奖励的主动强化学习(RLAVR),主动获取少数精选样本的真实标签,并将其与伪标签集成,从而稳定训练动态,在有限标注预算下提升性能。为识别有价值的样本,我们提出正确性优势间隔(CAG)指标,分析样本级别的监督价值。基于此,我们引入将 oracle CAG 准则转化为实用预查询获取策略的、受校正可靠性估计的 RLAVR(CARE),大幅提升训练稳定性。广泛实验覆盖多样领域、模型家族和模型规模,证明了方法的有效性和通用性。我们的代码已发布于 https://github.com/Lumina04/CARE。
引用
@article{arxiv.2605.25864,
title = {When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards},
author = {Li Wang and Xiaodong Lu and Xiaohan Wang and Yikun Ban and Jiajun Chai and Wei Lin and Tianhao Peng and Guojun Yin},
journal= {arXiv preprint arXiv:2605.25864},
year = {2026}
}