中文

大语言模型中RLHF的奥秘 第一部分:PPO

计算与语言 2023-07-19 v2 人工智能 机器学习

摘要

大语言模型(LLMs)已勾勒出通用人工智能发展的蓝图。其主要目标是作为以人为中心的(有用、诚实、无害)助手。与人类的对齐至关重要,而基于人类反馈的强化学习(RLHF)成为支撑这一追求的关键技术范式。当前技术路线通常包括用于衡量人类偏好的\textbf{奖励模型}、用于优化策略模型输出的\textbf{近端策略优化}(PPO),以及用于提升逐步推理能力的\textbf{过程监督}。然而,由于奖励设计、环境交互和智能体训练的挑战,加上大语言模型巨大的试错成本,AI研究者推动技术对齐与LLMs安全落地面临显著障碍。RLHF的稳定训练仍是一个难题。在第一份报告中,我们剖析RLHF框架,重新评估PPO的内部机制,并探究构成PPO算法的各部分如何影响策略智能体训练。我们确定策略约束是PPO算法有效实施的关键因素。因此,我们探索PPO-max,一种PPO算法的高级版本,以有效提升策略模型的训练稳定性。基于主要结果,我们与SFT模型和ChatGPT相比,对RLHF能力进行了全面分析。开源实现的缺失给LLMs对齐研究带来了重大挑战。因此,我们迫切希望发布技术报告、奖励模型和PPO代码,旨在为LLMs的发展做出微薄贡献。

关键词

引用

@article{arxiv.2307.04964,
  title  = {Secrets of RLHF in Large Language Models Part I: PPO},
  author = {Rui Zheng and Shihan Dou and Songyang Gao and Yuan Hua and Wei Shen and Binghai Wang and Yan Liu and Senjie Jin and Qin Liu and Yuhao Zhou and Limao Xiong and Lu Chen and Zhiheng Xi and Nuo Xu and Wenbin Lai and Minghao Zhu and Cheng Chang and Zhangyue Yin and Rongxiang Weng and Wensen Cheng and Haoran Huang and Tianxiang Sun and Hang Yan and Tao Gui and Qi Zhang and Xipeng Qiu and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2307.04964},
  year   = {2023}
}