中文

R3:鲁棒评分标准无关的奖励模型

计算与语言 2025-09-23 v3 人工智能 机器学习

摘要

奖励模型对于将语言模型输出与人类偏好对齐至关重要,但现有方法通常缺乏可控性和可解释性。这些模型通常针对狭窄目标进行优化,限制了其向更广泛下游任务的泛化能力。此外,其标量输出在没有上下文推理的情况下难以解释。为解决这些局限性,我们提出了 \shortmethodname\shortmethodname,一种新颖的奖励建模框架,该框架评分标准无关、可跨评估维度泛化,并提供可解释的、有推理依据的评分分配。\shortmethodname\shortmethodname 实现了对语言模型更透明、更灵活的评估,支持与多样化人类价值观和用例的鲁棒对齐。我们的模型、数据和代码在 https://github.com/rubricreward/r3 上以开源形式提供。

关键词

引用

@article{arxiv.2505.13388,
  title  = {R3: Robust Rubric-Agnostic Reward Models},
  author = {David Anugraha and Zilu Tang and Lester James V. Miranda and Hanyang Zhao and Mohammad Rifqi Farhansyah and Garry Kuwanto and Derry Wijaya and Genta Indra Winata},
  journal= {arXiv preprint arXiv:2505.13388},
  year   = {2025}
}

备注

Preprint