中文

RLHF 工作流程:从奖励建模到在线 RLHF

机器学习 2024-11-13 v3 人工智能 计算与语言 机器学习

摘要

我们在本技术报告中介绍了在线迭代强化学习从人类反馈 (RLHF) 的工作流程,该工作流程在最近的大型语言模型 (LLM) 文献中被广泛报告为优于其离线对等物的显著性能。在此技术报告中,我们旨在填补这一差距,为在线迭代 RLHF 提供详细且易于复现的配方。具体而言,由于在线人类反馈通常对资源有限的开源社区不可行,我们首先使用多样化的开源数据集构建偏好模型,并使用构建的代理偏好模型来模拟人类反馈。然后,我们讨论在线迭代 RLHF 的理论见解和算法原理,随后进行详细的实际实现。我们的训练 LLM 在 LLM chatbot 基准测试中实现了惊人的性能,包括 AlpacaEval-2、Arena-Hard 和 MT-Bench,以及其他学术基准如 HumanEval 和 TruthfulQA。我们已显示,监督微调 (SFT) 和迭代 RLHF 可获得全开源数据集的 state-of-the-art 性能。进一步地,我们已将模型、精选数据集和全面的分步代码指南公开于 https://github.com/RLHFlow/RLHF-Reward-Modeling 和 https://github.com/RLHFlow/Online-RLHF。

关键词

引用

@article{arxiv.2405.07863,
  title  = {RLHF Workflow: From Reward Modeling to Online RLHF},
  author = {Hanze Dong and Wei Xiong and Bo Pang and Haoxiang Wang and Han Zhao and Yingbo Zhou and Nan Jiang and Doyen Sahoo and Caiming Xiong and Tong Zhang},
  journal= {arXiv preprint arXiv:2405.07863},
  year   = {2024}
}

备注

Published in Transactions on Machine Learning Research (09/2024)