ChatGLM-RLHF:大语言模型与人类反馈对齐的实践
计算与语言
2024-04-04 v2
摘要
ChatGLM 是一项由 ChatGLM 系列大语言模型(LLM)驱动的免费使用的 AI 服务。在本文中,我们提出了 ChatGLM-RLHF 流水线——一个基于人类反馈的强化学习(RLHF)系统——旨在增强 ChatGLM 与人类偏好的对齐。ChatGLM-RLHF 包含三个主要部分:人类偏好数据的收集、奖励模型的训练和策略的优化。在将 ChatGLM-RLHF 集成到生产环境的过程中,我们遇到并解决了一些前所未有的挑战。我们引入了缓解奖励方差以稳定大规模训练的策略,实现了带有融合梯度下降的模型并行,并设计了正则化约束以避免 LLM 中的灾难性遗忘。实验表明,与 ChatGLM 的监督微调(SFT)版本相比,ChatGLM-RLHF 在对齐任务中带来了显著改进。例如,在中文对齐任务中,它平均比 ChatGLM-SFT 多获得 15% 的胜率。这项工作展示了我们将 LLM 与人类偏好对齐的实践,为 RLHF 实施中的挑战和解决方案提供了见解。
关键词
引用
@article{arxiv.2404.00934,
title = {ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback},
author = {Zhenyu Hou and Yilin Niu and Zhengxiao Du and Xiaohan Zhang and Xiao Liu and Aohan Zeng and Qinkai Zheng and Minlie Huang and Hongning Wang and Jie Tang and Yuxiao Dong},
journal= {arXiv preprint arXiv:2404.00934},
year = {2024}
}