细粒度人类反馈为语言模型训练提供更优奖励
计算与语言
2023-10-31 v2
摘要
语言模型(LMs)经常表现出不良的文本生成行为,包括生成虚假、有毒或无关的输出。基于人类反馈的强化学习(RLHF)——将人类对 LM 输出的偏好判断转化为学习信号——近来在解决这些问题上显示出前景。然而,此类整体反馈对长文本输出的信息传达有限;它未指明输出的哪些方面影响了用户偏好,例如哪些部分包含何种类型的错误。在本文中,我们使用细粒度人类反馈(例如,哪句话是虚假的,哪个子句是无关的)作为显式训练信号。我们提出 Fine-Grained RLHF,一个能够从两方面细粒度的奖励函数中训练和学习的框架:(1)密度,在每生成一个片段(如句子)后提供奖励;(2)结合与不同反馈类型(如事实错误、无关性和信息不完整)关联的多个奖励模型。我们在解毒和长形式问答上开展实验,以说明使用此类奖励函数学习如何带来性能提升,并得到自动和人工评估的支持。此外,我们展示了可通过不同细粒度奖励模型组合定制 LM 行为。我们在 https://FineGrainedRLHF.github.io 发布了所有数据、收集的人类反馈和代码。
引用
@article{arxiv.2306.01693,
title = {Fine-Grained Human Feedback Gives Better Rewards for Language Model Training},
author = {Zeqiu Wu and Yushi Hu and Weijia Shi and Nouha Dziri and Alane Suhr and Prithviraj Ammanabrolu and Noah A. Smith and Mari Ostendorf and Hannaneh Hajishirzi},
journal= {arXiv preprint arXiv:2306.01693},
year = {2023}
}
备注
NeurIPS 2023 camera-ready