面向人类反馈的参数高效强化学习
机器学习
2024-09-16 v2 人工智能
计算与语言
摘要
虽然基于人类反馈的强化学习(RLHF)有效地将预训练的大型语言模型和视觉语言模型(LLMs 和 VLMs)与人类偏好相匹配,但其计算成本和复杂度仍制约了其更广泛的应用。为缓解微调的部分计算负担,人们引入了诸如 LoRA 等参数高效方法。本文我们对参数高效强化学习从人类反馈(PE-RLHF)的设置进行经验性评估,该方法利用 LoRA 进行奖励建模和强化学习。我们在六个多样化的数据集上对 PE-RLHF 设置进行基准测试,涵盖摘要生成、无害/有用响应生成、界面自动化和视觉问答任务,评估训练模型的效果以及所需的训练资源。我们的发现表明,首次实现了 PE-RLHF 达到与 RLHF 相当的性能,同时显著减少训练时间(奖励模型最快可缩短 90%,RL 最快可缩短 30%),以及内存占用(奖励模型最高可减少 50%,RL 最高可减少 27%)。我们对 LoRA 秩和模型大小进行了详尽的消融实验,涵盖奖励建模和强化学习。通过减轻 RLHF 相关的计算负担,我们推动了 PE-RLHF 作为 LLMs 和 VLMs 对齐技术的更广泛采用。
关键词
引用
@article{arxiv.2403.10704,
title = {Parameter Efficient Reinforcement Learning from Human Feedback},
author = {Hakim Sidahmed and Samrat Phatale and Alex Hutcheson and Zhuonan Lin and Zhang Chen and Zac Yu and Jarvis Jin and Simral Chaudhary and Roman Komarytsia and Christiane Ahlheim and Yonghao Zhu and Bowen Li and Saravanan Ganesh and Bill Byrne and Jessica Hoffmann and Hassan Mansoor and Wei Li and Abhinav Rastogi and Lucas Dixon},
journal= {arXiv preprint arXiv:2403.10704},
year = {2024}
}