利用高效奖励模型集成改进基于人类反馈的强化学习
机器学习
2024-10-23 v3 人工智能
计算与语言
摘要
基于人类反馈的强化学习(RLHF)是一种广泛用于使大语言模型与人类价值观对齐的方法。然而,RLHF 依赖于使用有限数量的人类偏好数据训练的奖励模型,这可能导致预测不准确。因此,RLHF 可能会产生与人类价值观不一致的输出。为了缓解这一问题,我们提出了一种奖励集成方法,使奖励模型能够做出更准确的预测。由于使用基于大语言模型的奖励模型集成可能在计算和资源上代价高昂,我们探索了包括线性层集成和基于 LoRA 的集成在内的高效集成方法。实证上,我们在集成奖励模型上运行了 Best-of-和近端策略优化(Proximal Policy Optimization),并验证了我们的集成方法有助于提高 RLHF 输出的对齐性能。
引用
@article{arxiv.2401.16635,
title = {Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble},
author = {Shun Zhang and Zhenfang Chen and Sunli Chen and Yikang Shen and Zhiqing Sun and Chuang Gan},
journal= {arXiv preprint arXiv:2401.16635},
year = {2024}
}