中文

通过奖励过优化视角重新思考奖励模型评估

机器学习 2025-05-20 v1 人工智能 计算与语言

摘要

奖励模型 (RM) 在强化学习人类反馈 (RLHF) 中扮演着关键角色,使模型行为与人类偏好相匹配。然而,现有奖励模型基准与优化策略性能之间显示出弱相关性,这表明它们未能准确评估奖励模型的真实能力。为弥合这一差距,我们通过奖励过优化视角探索了几种评估设计——这是一种捕捉奖励模型如何与人类偏好匹配以及其为策略提供学习信号动态的现象。结果突出了三项关于如何构建可靠基准的关键发现:(i) 超越正确性之外,最小化所选响应与被拒绝响应之间的差异至关重要;(ii) 评估奖励模型需要在广泛的所选和被拒绝响应范围内进行多次比较;(iii) 鉴于奖励模型会遇到来自不同表示形式的响应,应来自不同模型的响应。我们还观察到,奖励过优化程度与某些下游性能的相关性极高会导致其与特定下游性能的相关性较低。因此,在设计基准时,使用奖励过优化程度作为有用的工具,而非最终目标是理想的。

关键词

引用

@article{arxiv.2505.12763,
  title  = {Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization},
  author = {Sunghwan Kim and Dongjin Kang and Taeyoon Kwon and Hyungjoo Chae and Dongha Lee and Jinyoung Yeo},
  journal= {arXiv preprint arXiv:2505.12763},
  year   = {2025}
}

备注

Accepted to ACL 2025