RMGAP: 测试奖励模型在多样化偏好下的泛化能力
计算与语言
2026-05-05 v1 人工智能
摘要
从人类反馈中进行强化学习已成为语言模型对齐的标准范式,其中奖励模型直接决定对齐效果。本文聚焦于如何评估奖励模型的泛化能力。我们所说的“泛化”,指的是奖励模型正确排序符合多样化用户偏好 responses 的能力。然而,现有的奖励模型基准测试通常围绕通用偏好设计,无法评估这种泛化。为此,我们引入RMGAP,一个包含1,097个实例的基准,覆盖Chat、Writing、Reasoning和Safety四个领域。由于不同用户对同一任务表现出不同的偏好,我们首先为每个收集的提示生成四个具有不同语言特征的响应。然而,原始提示集合缺乏足够的具体性来传达不同的偏好。因此,我们通过对比这些候选响应并设计情景以使一个响应成为唯一合适的选择,从而构建针对性的提示。此外,我们观察到用户常使用不同的措辞表达相同的偏好,因此为每个提示扩展了两个改写变体。我们对24个最先进的奖励模型进行评估,发现其泛化能力存在严重限制:即使是最好的奖励模型也仅实现49.27%的最佳- N 准确率,这凸显了奖励模型泛化能力仍有很大的提升空间。相关数据和代码均已公开于 https://github.com/nanzhi84/RMGAP。
引用
@article{arxiv.2605.01831,
title = {RMGAP: Benchmarking the Generalization of Reward Models across Diverse Preferences},
author = {Yangyang Zhou and Yi-Chen Li},
journal= {arXiv preprint arXiv:2605.01831},
year = {2026}
}
备注
25 pages, 3 figures