中文

学习纠错:多尝试链式思维的校准强化学习

机器学习 2026-04-21 v1 人工智能

摘要

最新推理模型利用长链式思维(CoT)通过增加推理步骤来解决日益复杂的问题。本文探讨一种长 CoT 场景:模型在解决问题时可进行最多 K 次连续尝试,每一次尝试都可在获得硬性验证反馈后基于之前的尝试进行构建。这就动机了能够有效利用每次尝试奖励的 RL 方法。我们研究优化 Verification@K 奖励(即模型在第 K 次尝试前成功),指出 naive 按通过/失败对尝试进行加权会导致偏差梯度。我们提出校准的尝试级(CAL)GRPO 方法,通过设计加权策略获取无偏梯度,同时保持较小方差。我们的理论揭示了纳入每次尝试奖励如何影响训练及最终 Verification@K 性能。实验、基线和消融实验在合成数据和真实数据上都证实了我们的理论以及 CAL-GRPO 相较于 vanilla GRPO 以及 naive 加权方法的优势。

关键词

引用

@article{arxiv.2604.17912,
  title  = {Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought},
  author = {Muhammed Emrullah Ildiz and Halil Alperen Gozeten and Ege Onur Taga and Samet Oymak},
  journal= {arXiv preprint arXiv:2604.17912},
  year   = {2026}
}

备注

24 pages