OpenRubrics:面向奖励建模与LLM对齐的可扩展合成评分标准生成
计算与语言
2026-02-04 v3
摘要
奖励建模是强化学习从人类反馈(RLHF)中的核心环节,但大多数现有奖励模型依赖标量或两两判断,难以捕捉人类偏好多维度的本质。近期研究探索将评分标准作为奖励(rubrics-as-rewards, RaR),使用结构化准则捕捉响应质量的多个维度。然而,生产可靠且可扩展的评分标准仍是关键挑战。本文我们引入OpenRubrics,一个多样且大规模的(提示,评分标准)对集合,用于训练评分标准生成和基于评分标准的奖励模型。为引导产生具备判别性和全面性评估信号的评分标准,我们引入对比评分标准生成(Contrastive Rubric Generation, CRG),通过对比优选响应与被拒绝响应来导出硬规则(显式约束)和原则(隐式质量)。我们进一步通过保持偏好标签一致性来去除噪声评分标准。在多个奖励建模基准测试中,我们基于评分标准的奖励模型Rubric-RM相较于强度匹配的基线提升了8.4%。这些收益在指令遵循和生物医学基准测试中的策略模型上也得以 transfer。
引用
@article{arxiv.2510.07743,
title = {OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment},
author = {Tianci Liu and Ran Xu and Tony Yu and Ilgee Hong and Carl Yang and Tuo Zhao and Haoyu Wang},
journal= {arXiv preprint arXiv:2510.07743},
year = {2026}
}
备注
The first two authors contributed equally. Updated OpenRubrics dataset, RMs, and results