中文

如何评估 RLHF 中的奖励模型

机器学习 2024-10-24 v2 人工智能 计算与语言

摘要

我们提出了新的基准测试,用于量化奖励模型在通过 RLHF(强化学习从人类反馈)产生强大语言模型能力的水平。金标准方法是运行完整的 RLHF 训练管道,直接探测下游大语言模型性能。然而,这一过程代价高昂。为此,我们通过在代理任务上评估奖励模型来构建下游大语言模型性能的预测模型。这些代理任务包括大规模人类偏好数据集和可验证正确性偏好数据集,我们在12个领域中测度12项指标。为探究哪些奖励模型指标与金标准 RLHF 结果最相关,我们在大规模众包人类偏好平台上启动端到端 RLHF 实验,以观察奖励模型下游性能作为真实 ground truth。最终,我们将数据和发现编译为偏好代理评估(PPE),即首个明确链接到 post-RLHF 真实世界人类偏好性能的奖励模型基准测试,我们将其开源供公众使用和进一步开发。我们的代码和评估可在 https://github.com/lmarena/PPE 查找。

关键词

引用

@article{arxiv.2410.14872,
  title  = {How to Evaluate Reward Models for RLHF},
  author = {Evan Frick and Tianle Li and Connor Chen and Wei-Lin Chiang and Anastasios N. Angelopoulos and Jiantao Jiao and Banghua Zhu and Joseph E. Gonzalez and Ion Stoica},
  journal= {arXiv preprint arXiv:2410.14872},
  year   = {2024}
}