中文

$\textbf{Re}^{2}$:通过Re-solving强化学习解锁LLM推理

光学 2026-03-10 v1 生物物理

摘要

基于可验证奖励的强化学习(RLVR)已在通过增加测试时间计算量来提升大型语言模型(LLM)推理性能方面显示出前景。然而,即便经过大量RLVR训练,这些模型仍倾向于生成不必要且质量较低的链式思维(CoT)步骤,导致低效的过度思考和较低的答案质量。我们指出,当CoT的初始方向或质量不佳时,模型即使生成多个额外的token,仍可能未能得出正确答案。为此,我们引入基于Re-solving的强化学习(Re2^2),其中LLM学习在必要时灵活地放弃无生产性的推理路径并重新启动求解过程,而总是坚持给出最终答案。Re2^2采用纯粹的强化学习,无需任何初步的监督微调,成功地将vanilla模型中罕见的重做行为从仅0.5%提升至30%以上。这导致在相同的训练计算预算下,相对于标准RLVR实现了显著的性能提升,并在样本数增加时显示出显著的测试性能改进。

关键词

引用

@article{arxiv.2603.07196,
  title  = {Quantum Tunneling Enables High-Flux Transport in Ion Channels},
  author = {Bin Zhou and Yangmei Li and Ziyi Zhang and Yindong Huang and Zuoxian Xiang and Chao Chang},
  journal= {arXiv preprint arXiv:2603.07196},
  year   = {2026}
}