超越多数投票:面向测试时强化学习的细粒度更可靠奖励信号
计算与语言
2026-05-07 v4
摘要
测试时强化学习通过使用多数投票结果作为伪标签来减轻对标注数据的依赖,成为增强推理能力的强化学习可验证奖励(RLVR)的补充方向。然而,这种投票策略常导致确认偏差且奖励稀疏,限制整体性能。本文提出了子群特定的步骤置信度加权伪标签估计(SCOPE)框架,集成模型置信度和动态子群分区以解决上述问题。具体而言,SCOPE 将提出的步骤置信度整合到伪标签估计中,优先考虑高质量推理路径而非简单频率计数。此外,它通过在推理质量与探索多样性之间进行动态分区,将候选输出池划分为独立子群。通过对每个子群进行重复抽样以导出局部共识,SCOPE 提供多样化的监督目标以鼓励更广泛的探索。我们在各种模型和基准上进行实验,实验结果表明 SCOPE 在最新基线上 consistently 优于表现。值得注意的是,SCOPE 在挑战性 AIME 2025 上实现了 13.1% 的相对提升,在 AMC 上实现了 8.1% 的相对提升。代码已发布于 https://github.com/szu-tera/SCOPE。
引用
@article{arxiv.2512.15146,
title = {Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning},
author = {Weiqin Wang and Yile Wang and Kehao Chen and Hui Huang},
journal= {arXiv preprint arXiv:2512.15146},
year = {2026}
}
备注
Accepted to ACL 2026 Main Conference. 15 pages, 9 figures, 5 tables