原型奖励网络用于数据高效 RLHF
计算与语言
2024-07-09 v2 人工智能
摘要
强化学习从人类反馈(RLHF)的奖励模型已证明在微调大语言模型(LLM)方面具有有效性。值得注意的是,为 RLHF 收集人类反馈可能需要大量资源,并且会导致 LLM 和复杂任务的可扩展性问题。我们提出的框架 Proto-RM 利用原型网络在有限人类反馈条件下增强奖励模型。通过在更少的样本上实现稳定可靠的结构学习,Proto-RM 显著提升了 LLM 在解释人类偏好方面的适应性和准确性。在 various 数据集上的大量实验表明,Proto-RM 在数据受限场景下显著提高了奖励模型和 LLM 在人类反馈任务中的性能,通常能实现与传统方法相当甚至更好的效果,同时所需数据显著减少。这项研究为在受限反馈条件下提高奖励模型效率和优化语言模型微调提供了有前景的方向。
引用
@article{arxiv.2406.06606,
title = {Prototypical Reward Network for Data-Efficient RLHF},
author = {Jinghan Zhang and Xiting Wang and Yiqiao Jin and Changyu Chen and Xinhao Zhang and Kunpeng Liu},
journal= {arXiv preprint arXiv:2406.06606},
year = {2024}
}
备注
Accepted by ACL 2024