中文

RMB:全面基准化 LLM 对齐中的奖励模型

计算与语言 2025-04-07 v2

摘要

奖励模型 (RM) 指导大型语言模型 (LLM) 的对齐,使其行为更符合人类偏好。评估 RM 是改进 LLM 对齐的关键。然而,当前对 RM 的评估可能因评估数据的分布有限以及评估方法与对齐目标不够紧密而未能直接对应于其对齐性能。为此,我们提出 RMB,一个覆盖超过 49 个真实场景的全面 RM 基准,包括配对评估和 Best-of-N (BoN) 评估,以更好地反映 RM 在指导对齐优化中的有效性。我们表明,该基准与下游对齐任务性能呈正相关性。基于我们的基准,我们对现有的 SOTA RM 进行了广泛分析,揭示了以前基准未发现的其泛化缺陷,并突出了生成式 RM 的潜力。此外,我们深入探讨了奖励模型中的开放问题,具体包括多数投票用于奖励模型评估的有效性,以及生成式 RM 的影响因素,包括评估准则和指导方法的影响。我们的评估代码和数据集已提供,地址为 https://github.com/Zhou-Zoey/RMB-Reward-Model-Benchmark。

关键词

引用

@article{arxiv.2410.09893,
  title  = {RMB: Comprehensively Benchmarking Reward Models in LLM Alignment},
  author = {Enyu Zhou and Guodong Zheng and Binghai Wang and Zhiheng Xi and Shihan Dou and Rong Bao and Wei Shen and Limao Xiong and Jessica Fan and Yurong Mou and Rui Zheng and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2410.09893},
  year   = {2025}
}

备注

Accepted by ICLR2025