人类反馈强化学习中的偏好一致性影响:以摘要任务为例
计算与语言
2023-11-10 v1 人工智能
人机交互
摘要
人类反馈强化学习(RLHF)可用于捕捉文本生成质量的复杂且细微的属性。因此,文本摘要任务已被认为是该过程的良好候选。在本文中,我们探究偏好一致性如何影响 RLHF 在摘要中的有效性。我们表明,对人工偏好进行采样以包含一系列标注者一致性结果会导致(1)更高准确率的奖励模型,以及(2)改变了所捕捉质量的特征。我们还展示了使用以一系列偏好一致性训练的奖励模型时,下游生成的改进。我们的贡献对合成数据集的设计以及考虑基于比较的数据中质量差异的重要性具有启示意义。
引用
@article{arxiv.2311.04919,
title = {The Impact of Preference Agreement in Reinforcement Learning from Human Feedback: A Case Study in Summarization},
author = {Sian Gooding and Hassan Mansoor},
journal= {arXiv preprint arXiv:2311.04919},
year = {2023}
}