中文

RLHF 能否扩展?探索数据、模型和方法的影响

计算与语言 2024-12-10 v1 机器学习

摘要

本研究探讨了大型语言模型(LLM)中基于人类反馈的强化学习(RLHF)的扩展特性。尽管 RLHF 被认为是 LLM 后训练中的重要步骤,但其扩展潜力在很大程度上仍不为人知。我们系统地分析了 RLHF 框架中的关键组成部分——模型规模、数据组成和推理预算——及其对性能的影响。我们的研究表明,增加数据多样性和数量可以提升奖励模型性能,有助于基于过程监督的模型更好地扩展。对于策略训练,每个提示的更多响应样本最初能提升性能,但很快趋于饱和。更大的奖励模型在策略训练中提供适度的增益。此外,在固定奖励模型下,更大的策略模型从 RLHF 中获益更少。总体而言,RLHF 的扩展效率低于预训练,随着额外计算资源的增加,收益递减。基于这些观察,我们提出了在计算限制内优化 RLHF 性能的策略。

关键词

引用

@article{arxiv.2412.06000,
  title  = {Does RLHF Scale? Exploring the Impacts From Data, Model, and Method},
  author = {Zhenyu Hou and Pengfan Du and Yilin Niu and Zhengxiao Du and Aohan Zeng and Xiao Liu and Minlie Huang and Hongning Wang and Jie Tang and Yuxiao Dong},
  journal= {arXiv preprint arXiv:2412.06000},
  year   = {2024}
}