中文

基于 PPO 的 RLHF 的 N+ 个实现细节:以 TL;DR 摘要生成为例的案例研究

机器学习 2024-03-27 v1

摘要

本研究首次公开复现了 OpenAI 开创性 TL;DR 摘要工作中报告的基于人类反馈的强化学习 (RLHF) 缩放行为。我们从零开始构建了 RLHF 流程,列举了 20 多个关键实现细节,并分享了复现过程中的关键见解。我们经过 RLHF 训练的 Pythia 模型在响应质量上表现出随模型规模增长而显著提升,其中我们的 2.8B 和 6.9B 模型优于 OpenAI 发布的 1.3B 检查点。我们公开发布了训练好的模型检查点和代码,以促进进一步研究并加速该领域的进展 (\url{https://github.com/vwxyzjn/summarize_from_feedback_details})。

关键词

引用

@article{arxiv.2403.17031,
  title  = {The N+ Implementation Details of RLHF with PPO: A Case Study on TL;DR Summarization},
  author = {Shengyi Huang and Michael Noukhovitch and Arian Hosseini and Kashif Rasul and Weixun Wang and Lewis Tunstall},
  journal= {arXiv preprint arXiv:2403.17031},
  year   = {2024}
}