中文

Long-form RewardBench:评估长文本生成奖励模型的基准

计算与语言 2026-03-16 v1

摘要

基于强化学习对齐技术的广泛采用凸显了奖励模型日益重要的地位。虽然已构建了 various 用于评估奖励模型在 various 场景下的基准,但在评估长文本生成的奖励模型方面仍存在显著差距,尽管这在实际应用中发挥着关键作用。为弥合这一差距,我们引入了 Long-form RewardBench——首个专为长文本生成设计的奖励模型测试平台。我们的基准涵盖五个关键子任务:QA、RAG、Chat、Writing 和 Reasoning。我们通过严谨设计的多阶段数据收集过程获取指令和偏好数据,并对 20+ 主流奖励模型进行了广泛实验,包括分类器和生成式模型。我们的发现表明,当前模型仍缺乏长文本奖励建模能力。此外,我们设计了一种新颖的 Long-form Needle-in-a-Haystack Test,揭示了奖励建模性能与错误位置以及整体响应长度之间存在相关性,分类模型和生成式模型之间观察到不同特征。最后,我们展示了分类器在相同数据上训练的生成式模型之上的更好通用性。作为长文本奖励建模的首个基准,本工作旨在为这一关键领域的进展提供一个稳健的平台。

关键词

引用

@article{arxiv.2603.12963,
  title  = {Long-form RewardBench: Evaluating Reward Models for Long-form Generation},
  author = {Hui Huang and Yancheng He and Wei Liu and Muyun Yang and Jiaheng Liu and Kehai Chen and Bing Xu and Conghui Zhu and Hailong Cao and Tiejun Zhao},
  journal= {arXiv preprint arXiv:2603.12963},
  year   = {2026}
}

备注

Accepted by AAAI2026