JURY-RL:投票提议,证明裁决——面向无标签 RLVR
人工智能
2026-04-29 v1
摘要
带有可验证奖励的强化学习(RLVR)增强了大型语言模型(LLMs)的推理能力,但标准 RLVR 通常依赖于人工标注的答案或精心设计的奖励规范。在机器可验证的领域中,多数投票或 LLM-as-a-judge 等无标签替代方案消除了标注成本,但可能引入破坏训练稳定性的假阳性。我们提出了 JURY-RL,一个无标签 RLVR 框架,将答案提议与奖励裁决解耦:来自模型展开(rollouts)的投票提议一个候选答案,而形式化验证器决定该候选答案是否能获得正奖励。具体而言,只有与多数投票答案匹配的展开,在 Lean 中成功验证该答案时才会获得奖励。当验证结论不明确时,我们调用 ResZero(Residual-Zero),这是一种后备奖励机制,它丢弃未经验证的多数提议,并在剩余答案上重新分配零均值、保方差的信号。该设计在不强化不可验证共识的情况下维持了稳定的优化梯度。在基于数学数据训练的三个骨干模型上,JURY-RL 在数学推理基准上始终优于其他无标签基线,并具有竞争力的迁移能力至代码生成和通用基准。它达到了与有监督真值训练相当的 pass@1 性能,并通过更高的 pass@k 和响应多样性展现出更优的泛化能力。
引用
@article{arxiv.2604.25419,
title = {JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR},
author = {Xinjie Chen and Biao Fu and Jing Wu and Guoxin Chen and Xinggao Liu and Dayiheng Liu and Minpeng Liao},
journal= {arXiv preprint arXiv:2604.25419},
year = {2026}
}
备注
Preprint. 32 pages, 9 figures