它需要两个人:奖励模型与策略模型之间无缝衔接的研究
计算与语言
2024-06-14 v2 人工智能
机器学习
摘要
强化学习从人类反馈(RLHF)涉及训练策略模型(PM)和奖励模型(RM),以使语言模型与人类偏好相匹配。与其专注于独立地研究PM和RM,不如在微调过程中考察它们的相互作用,提出“无缝衔接性”(seamlessness)的概念。本研究发现,RM和PM的持续改进并未转化为RLHF的实际进步,于是展开分析。结果显示,RM未能为PM的响应分配合适的评分,导致与人类偏好的匹配率下降了35%,凸显了PM与RM之间显著的差异。为衡量PM与RM之间的无缝衔接性,我们提出了一种无需人工干预的自动度量指标——SEAM。SEAM量化了由数据样本引起的PM与RM判断之间的差异。我们验证了SEAM在数据选择和模型扩充中的有效性。实验表明,(1) 使用SEAM过滤后的数据进行RL训练可使RLHF性能提升4.5%;(2) SEAM引导的模型扩充相较于标准扩充方法提升了4%的性能。
引用
@article{arxiv.2406.07971,
title = {It Takes Two: On the Seamlessness between Reward and Policy Model in RLHF},
author = {Taiming Lu and Lingfeng Shen and Xinyu Yang and Weiting Tan and Beidi Chen and Huaxiu Yao},
journal= {arXiv preprint arXiv:2406.07971},
year = {2024}
}