VI-CuRL:通过置信度引导的方差归约稳定Verifier-Independent RL 推理
机器学习
2026-05-25 v2 人工智能
摘要
基于可验证奖励的强化学习 (RLVR) 已成为增强大型语言模型 (LLM) 推理能力的主导范式,但其对外部验证器的依赖限制了可扩展性。最近的发现表明,RLVR主要是通过激发潜在能力来发挥作用,从而推动了无验证器算法的开发。然而,在此类设置中,诸如Group Relative Policy Optimization等标准方法面临一个关键挑战:导致训练崩溃的破坏性梯度方差。为解决此问题,我们引入Verifier-Independent Curriculum Reinforcement Learning (VI-CuRL),一种利用模型内置置信度构建独立于外部验证器的课程的框架。通过优先处理高置信度样本,VI-CuRL有效地管理了偏差-方差之间的权衡,特别是针对行动方差和问题方差进行优化。我们提供了严格的理论分析,证明该估计器保证渐近无偏。实验上,VI-CuRL在数学和一般推理基准测试中稳定性优于基于验证器依赖/独立的基线方法。
引用
@article{arxiv.2602.12579,
title = {VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction},
author = {Xin-Qiang Cai and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2602.12579},
year = {2026}
}