中文

通过成对最大差异竞赛评估奖励模型泛化能力

计算与语言 2026-01-27 v1 人工智能

摘要

奖励模型(RM)是使大型语言模型对齐的核心,但其实际效果取决于对未见提示和分布漂移的泛化能力。大多数现有的RM评估依赖于静态的、预标注的偏好数据集,这些数据集覆盖范围有限,且常常无法在开放世界设置中忠实地评估泛化能力。我们引入了成对最大差异竞赛(PMDC),这是一个动态且标注高效的框架,用于使用大型、无标注、开放领域的提示池来评估RM泛化能力。PMDC主动选择使两个RM之间分歧最大化的提示-响应对,从而生成一组紧凑且高度争议的测试用例。这些用例由仲裁者裁决,并通过Bradley-Terry模型聚合结果,以生成RM的全局排名和成对胜率图。我们将PMDC应用于重新评估10个代表性RM,并观察到与常规基准相比显著的排名洗牌。定性分析进一步揭示了系统性的泛化失败,为改进奖励建模提供了宝贵的见解。

关键词

引用

@article{arxiv.2601.16987,
  title  = {Evaluating Reward Model Generalization via Pairwise Maximum Discrepancy Competitions},
  author = {Shunyang Luo and Peibei Cao and Zhihui Zhu and Kehua Feng and Zhihua Wang and Keyan Ding},
  journal= {arXiv preprint arXiv:2601.16987},
  year   = {2026}
}

备注

17 pages, 6 figures, 2 tables