双共识:通过两阶段投票机制逃离无标签强化学习中的虚假多数
机器学习
2026-03-18 v1
摘要
当前的无标签强化学习强化学习方法(如 TTRL 和 Self-reward)在提高大型语言模型(LLM)在复杂推理任务上的性能方面已显示出有效性。然而,这些方法高度依赖于准确的伪标签估计,并在虚假且流行的答案上收敛,从而陷入主导模式,限制了进一步的改进。基于此,我们提出了双共识强化学习(DCRL),一种新型自监督训练方法,通过两阶段共识机制生成更可靠的学习信号。该模型最初充当锚点,产生主导响应;随后充当探索者,通过临时忘却过程生成多样的辅助信号。最终的训练目标来源于这两组信号的调和平均。值得注意的是,该过程完全无需外部模型或监督。在八个基准测试和多样领域中,DCRL 在多数投票中持续提高 Pass@1,同时实现更稳定的训练动力学。这些结果表明,DCRL 为无标签的情况下建立了通往更强推理能力的可扩展路径。
引用
@article{arxiv.2603.16223,
title = {Dual Consensus: Escaping from Spurious Majority in Unsupervised RLVR via Two-Stage Vote Mechanism},
author = {Kaixuan Du and Meng Cao and Hang Zhang and Yukun Wang and Xiangzhou Huang and Ni Li},
journal= {arXiv preprint arXiv:2603.16223},
year = {2026}
}
备注
10 pages, 5 figures