中文

奖励建模中基模型选择的系统性分析

计算与语言 2025-05-19 v1 人工智能

摘要

强化学习从人类反馈(RLHF)以及其核心——奖励建模,已成为训练强大大语言模型(LLM)的关键环节。然而,在训练高质量奖励模型(RM)时,常被忽视的一个因素是基模型的选择,而这在面对快速增长的 LLM 池时正变得愈发困难。本文对基模型选择对奖励建模性能影响进行系统性分析。我们的结果表明,性能可比最常用(即默认)选择提高最高可达 14%。此外,我们展示了一些现有基准测试与下游性能之间的强统计关系。我们还演示了可以将来自小型基准集合的结果组合以提升模型选择(在前 5-10 位的平均性能提升可达 +18%)。最后,我们说明了不同后训练步骤对最终性能的影响,并探索了使用估计数据分布来减少性能预测误差。

关键词

引用

@article{arxiv.2505.10775,
  title  = {A Systematic Analysis of Base Model Choice for Reward Modeling},
  author = {Kian Ahrabian and Pegah Jandaghi and Negar Mokhberian and Sai Praneeth Karimireddy and Jay Pujara},
  journal= {arXiv preprint arXiv:2505.10775},
  year   = {2025}
}

备注

19 pages, 13 figures, 5 tables