RM-Bench:用于评估语言模型奖励模型对细微差别和风格敏感性的基准
计算与语言
2024-10-22 v1
摘要
奖励模型在基于人类反馈的强化学习(RLHF)和推理缩放定律等关键技术中至关重要,它们用于指导语言模型对齐并选择最优响应。尽管奖励模型很重要,但现有的评估方法通常要求模型区分由不同能力模型生成的响应,这无法评估奖励模型对细微但关键的内容变化和风格变化的敏感性,导致与策略模型性能的相关性较低。为此,我们引入了 RM-Bench,这是一个旨在根据奖励模型对细微内容差异的敏感性和对风格偏差的抵抗力来评估它们的基准。大量实验表明,RM-Bench 与策略模型性能高度相关,可作为选择奖励模型以有效对齐语言模型的可靠参考。我们评估了近 40 个奖励模型,结果显示,即使是最先进的模型在 RM-Bench 上的平均性能也仅为 46.6%,低于随机水平(50%)。这些发现凸显了奖励模型仍有很大的改进空间。相关代码和数据可在 https://github.com/THU-KEG/RM-Bench 获取。
引用
@article{arxiv.2410.16184,
title = {RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style},
author = {Yantao Liu and Zijun Yao and Rui Min and Yixin Cao and Lei Hou and Juanzi Li},
journal= {arXiv preprint arXiv:2410.16184},
year = {2024}
}