奖励模型为何是良好教师?——来自优化视角的分析
机器学习
2026-03-02 v4 人工智能
计算与语言
机器学习
摘要
强化学习从人类反馈 (RLHF) 的成功性严重依赖于奖励模型的质量。然而,尽管这种质量主要通过准确性进行评估,但是否完全捕捉了什么使得奖励模型成为有效教师 remains unclear。我们从优化视角来回答此问题。首先,我们证明了无论奖励模型有多准确,如果其导致奖励方差较低,则 RLHF 目标将面临平坦的 landscapes。因此,即便是一个完美准确的奖励模型,也可能导致优化极其缓慢,甚至不及那些诱导更高奖励方差的较不准确的模型。我们 additionally 表明,一个在一个语言模型上表现良好的奖励模型,可能为另一个语言模型诱导低奖励方差,从而导致平坦的目标 landscapes。这些结果建立了仅基于准确性或独立于其引导的语言模型来评估奖励模型的根本性局限性。使用最多8B参数的模型进行实验,支持了我们的理论,表明了奖励方差、准确性和奖励最大化率之间的相互作用。总体而言,我们的发现表明,除了准确性外,奖励模型还需要诱导足够的方差以实现高效优化。
引用
@article{arxiv.2503.15477,
title = {What Makes a Reward Model a Good Teacher? An Optimization Perspective},
author = {Noam Razin and Zixuan Wang and Hubert Strauss and Stanley Wei and Jason D. Lee and Sanjeev Arora},
journal= {arXiv preprint arXiv:2503.15477},
year = {2026}
}
备注
Accepted to NeurIPS 2025; Code available at https://github.com/princeton-pli/what-makes-good-rm