R3:鲁棒评分标准无关的奖励模型
计算与语言
2025-09-23 v3 人工智能
机器学习
摘要
奖励模型对于将语言模型输出与人类偏好对齐至关重要,但现有方法通常缺乏可控性和可解释性。这些模型通常针对狭窄目标进行优化,限制了其向更广泛下游任务的泛化能力。此外,其标量输出在没有上下文推理的情况下难以解释。为解决这些局限性,我们提出了 ,一种新颖的奖励建模框架,该框架评分标准无关、可跨评估维度泛化,并提供可解释的、有推理依据的评分分配。 实现了对语言模型更透明、更灵活的评估,支持与多样化人类价值观和用例的鲁棒对齐。我们的模型、数据和代码在 https://github.com/rubricreward/r3 上以开源形式提供。
引用
@article{arxiv.2505.13388,
title = {R3: Robust Rubric-Agnostic Reward Models},
author = {David Anugraha and Zilu Tang and Lester James V. Miranda and Hanyang Zhao and Mohammad Rifqi Farhansyah and Garry Kuwanto and Derry Wijaya and Genta Indra Winata},
journal= {arXiv preprint arXiv:2505.13388},
year = {2025}
}
备注
Preprint