中文

Tournament-GRPO: 面向开放式长文本生成强化学习的组内锦标赛奖励机制

计算与语言 2026-05-27 v1 人工智能

摘要

在开放式长文本生成中进行强化学习具有挑战性,因为可靠的参考答案和自动评估指标通常不可用。现有的基于评分准则的方法通常依赖于点式的LLM-as-a-judge评分,但绝对分数难以在复杂响应间进行校准,可能无法有效区分同一查询的生成结果,并且在优化过程中可能饱和。我们提出Tournament-GRPO,一种组内奖励框架,通过在同一查询的生成结果之间进行多轮重复锦标赛,将基于评分准则的LLM判断转化为相对奖励。Tournament-GRPO在组内比较候选结果,累积锦标赛结果,并将其归一化为用于GRPO训练的组内奖励。在Deep Research Bench上的实验表明,Tournament-GRPO持续优于现有的奖励设计基线,相较于最强基线实现了4.52分的总体得分提升。进一步分析表明,锦标赛奖励提供了有利的有效性-效率权衡,并且锦标赛设计会影响训练动态。这些结果表明,基于评分准则的锦标赛比较为开放式长文本生成中的强化学习提供了有效的奖励信号。

关键词

引用

@article{arxiv.2605.26958,
  title  = {Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation},
  author = {Zixuan Yang and Yiqun Chen and Wei Yang and Erhan Zhang and Zihan Shen and Xiaochi Wei and Yan Gao and Yi Wu and Yao Hu and Jiaxin Mao},
  journal= {arXiv preprint arXiv:2605.26958},
  year   = {2026}
}