CE-RM:基于双阶段 rollout 与统一准则优化的点评生成式奖励模型
计算与语言
2026-02-03 v2
摘要
自动评估开放式自然语言生成至关重要且具挑战性,尤其当规则基准指标不可行时。与传统方法相比,近期的 LLM-as-a-Judge 范式实现了更好的灵活性与性能,并在强化学习中作为生成式奖励模型展现出前景。然而,既有工作揭示了其在基准测试中看似卓越的表现与实际 RL 实践效果之间存在显著差距。我们认为此问题源于既有研究的局限,包括:\textbf{(i) 两两评估的主导地位};\textbf{(ii) 评估准则的优化不足}。因此,我们提出 CE-RM-4B,一种采用专门双阶段 rollout 方法并采用统一查询基准的点评生成式奖励模型。仅需约 5.7 万高质量数据(从开源偏好数据集中筛选),我们的 CE-RM-4B 在多样化奖励模型基准测试中实现卓越表现,尤其在 Best-of-N 场景下,并为下游 RL 实践带来更有效的改进。
关键词
引用
@article{arxiv.2601.20327,
title = {CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified Criteria},
author = {Xinyu Hu and Yancheng He and Weixun Wang and Tao Feng and Li Lin and Jiashun Liu and Wenbo Su and Bo Zheng and Xiaojun Wan},
journal= {arXiv preprint arXiv:2601.20327},
year = {2026}
}
备注
Under Review