中文

言多必失:缓解人类反馈强化学习中的长度偏差

计算与语言 2023-11-30 v5

摘要

人类反馈强化学习(RLHF)是一座关键桥梁,使大语言模型(LLM)与人类及社会价值观对齐。这种对齐需要海量人类反馈语料来学习奖励模型,随后用于微调语言模型。然而,我们发现奖励模型常寻找捷径以绕过其预期目标,错误地假定人类偏好更长的回复。长度偏差的出现常诱导模型偏爱更长输出,但这并不等同于这些输出中有用信息的增加。本文提出一种创新解决方案,应用专家乘积(PoE)技术将奖励建模与序列长度的影响分离。在我们的框架中,主专家专注于理解人类意图,而有偏专家致力于识别并捕捉长度偏差。为进一步加强偏差学习,我们向聚焦偏差的专家引入扰动,阻断语义信息的流动。实验结果验证了方法的有效性,表明无论序列长度如何,语言模型性能均得到提升。

关键词

引用

@article{arxiv.2310.05199,
  title  = {Loose lips sink ships: Mitigating Length Bias in Reinforcement Learning from Human Feedback},
  author = {Wei Shen and Rui Zheng and Wenyu Zhan and Jun Zhao and Shihan Dou and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2310.05199},
  year   = {2023}
}

备注

EMNLP 2023 findings, Length Bias in RLHF, Mitigate bias in reward modeling