中文

面向开放式 R1 训练的语义感知奖励:用于自由形式生成

计算与语言 2025-06-19 v1 机器学习

摘要

评估开放式长文本生成具有挑战性,因为很难明确界定良好输出与差差输出的界限。现有方法常常忽略诸如连贯性、风格或相关性等关键方面,或受预训练数据偏好影响,使得开放式长文本评估仍是一个未被充分探索的问题。为填补这一空白,我们提出了 PrefBERT,这是一个用于评估开放式长文本生成的评分模型,并通过为良好输出和差差输出分别设计不同的奖励来指导其训练。我们在两个具有多样化长文本风格和 Likert 评分质量的响应评估数据集上训练了 PrefBERT,有效地支持了 GRPO,提供了比传统指标 ROUGE-L 和 BERTScore 更具语义奖励反馈的能力。通过全面评估,包括 LLM 作为裁判、人类评分和定性分析,我们展示了 PrefBERT(在多句子和段落长度响应上训练)在 varied long passages 中保持可靠性,并与可验证的奖励 GRPO 对齐良好。人类评估确认,使用 PrefBERT 作为训练策略模型奖励信号,可产生更符合人类偏好的响应。我们的代码已在 https://github.com/zli12321/long_form_rl 上提供。

关键词

引用

@article{arxiv.2506.15068,
  title  = {Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation},
  author = {Zongxia Li and Yapei Chang and Yuhang Zhou and Xiyang Wu and Zichao Liang and Yoo Yeon Sung and Jordan Lee Boyd-Graber},
  journal= {arXiv preprint arXiv:2506.15068},
  year   = {2025}
}