中文

通过自演化评分标准强化链式思维推理

人工智能 2026-02-12 v1 机器学习

摘要

尽管链式思维 (CoT) 在 LLM 推理中发挥着关键作用,但直接对其进行奖励困难:训练奖励模型需要大量的人工标注,而静态奖励模型又难以应对不断演变的 CoT 分布和奖励作弊。这些挑战促使我们寻求一种无需人工标注即可自行演化的 CoT 奖励方法。灵感来自最近的自演化训练方法,我们提出了 RLCER (Reinforce Learning with CoT Supervision via Self-Evolving Rubrics),通过自提出和自演化评分标准来奖励 CoT,从而增强以结果为中心的 RLVR。我们表明,即使没有结果奖励,自提出和自演化评分标准也能提供可靠的 CoT 监督信号,使 RLCER 超越以结果为中心的 RLVR。此外,作为 in-prompt 提示使用时,这些自提出的评分标准进一步提高了推理时性能力。

关键词

引用

@article{arxiv.2602.10885,
  title  = {Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics},
  author = {Leheng Sheng and Wenchang Ma and Ruixin Hong and Xiang Wang and An Zhang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2602.10885},
  year   = {2026}
}

备注

21 pages