中文

双共识:通过两阶段投票机制逃离无标签强化学习中的虚假多数

机器学习 2026-03-18 v1

摘要

当前的无标签强化学习强化学习方法(如 TTRL 和 Self-reward)在提高大型语言模型(LLM)在复杂推理任务上的性能方面已显示出有效性。然而,这些方法高度依赖于准确的伪标签估计,并在虚假且流行的答案上收敛,从而陷入主导模式,限制了进一步的改进。基于此,我们提出了双共识强化学习(DCRL),一种新型自监督训练方法,通过两阶段共识机制生成更可靠的学习信号。该模型最初充当锚点,产生主导响应;随后充当探索者,通过临时忘却过程生成多样的辅助信号。最终的训练目标来源于这两组信号的调和平均。值得注意的是,该过程完全无需外部模型或监督。在八个基准测试和多样领域中,DCRL 在多数投票中持续提高 Pass@1,同时实现更稳定的训练动力学。这些结果表明,DCRL 为无标签的情况下建立了通往更强推理能力的可扩展路径。

关键词

引用

@article{arxiv.2603.16223,
  title  = {Dual Consensus: Escaping from Spurious Majority in Unsupervised RLVR via Two-Stage Vote Mechanism},
  author = {Kaixuan Du and Meng Cao and Hang Zhang and Yukun Wang and Xiangzhou Huang and Ni Li},
  journal= {arXiv preprint arXiv:2603.16223},
  year   = {2026}
}

备注

10 pages, 5 figures