利用领域知识实现 RLHF 中的高效奖励建模:电商观点摘要案例研究
计算与语言
2024-04-19 v2 机器学习
摘要
基于人类反馈的强化学习 (RLHF) 已成为使语言模型 (LM) 与人类价值观/目标对齐的主导策略。该策略的关键在于学习一个奖励模型 (),使其能够反映人类的潜在奖励模型。虽然该策略已被证明有效,但其训练方法需要大量的人类偏好标注(通常为数万条)来训练 。如果这是一次性努力且奖励模型具有通用性,如此大规模的标注是合理的。然而,人类目标是主观的且依赖于任务,需要特定任务的偏好标注,这往往难以实现。为应对这一挑战,我们提出了一种将领域知识注入 的新方法,该方法减少了所需的偏好标注量 (),消除了对齐税 (Alignment Tax),并提供了一定的可解释性。我们在电商观点摘要任务中验证了我们的方法,数据集规模显著减少(仅需 个样本),同时超越了最先进水平 (SOTA)(ROUGE-L 提升约 分, 的情况下优于 SOTA 并获人类偏好)。我们的贡献包括一种新颖的奖励建模技术和两个新数据集:PromptOpinSumm(用于观点摘要的监督数据)和 OpinPref(金标准人类偏好数据集)。所提出的方法为高效 RLHF 开辟了途径,使其更能适应具有不同人类价值观的应用。我们发布了相关制品(代码:github.com/efficient-rlhf。PromptOpinSumm:hf.co/prompt-opin-summ。OpinPref:hf.co/opin-pref),供用户在 MIT 许可证下使用。
引用
@article{arxiv.2402.15473,
title = {Leveraging Domain Knowledge for Efficient Reward Modelling in RLHF: A Case-Study in E-Commerce Opinion Summarization},
author = {Swaroop Nath and Tejpalsingh Siledar and Sankara Sri Raghava Ravindra Muddu and Rupasai Rangaraju and Harshad Khadilkar and Pushpak Bhattacharyya and Suman Banerjee and Amey Patil and Sudhanshu Shekhar Singh and Muthusamy Chelliah and Nikesh Garera},
journal= {arXiv preprint arXiv:2402.15473},
year = {2024}
}
备注
19 pages, 6 figures, 21 tables