中文

带绑定的偏好奖励学习

机器学习 2024-10-10 v1 人工智能

摘要

奖励学习在从人类反馈中进行强化学习 (RLHF) 中占据重要位置,确保语言模型的对齐。Bradley-Terry (BT) 模型是捕捉包含所选响应和被拒绝响应对的人类偏好的常用模型。在偏好建模中,关注的不是绝对值,而是所选响应与被拒绝响应之间的奖励差值,称为偏好强度。因此,对偏好强度的精确评估在偏好建模中至关重要。然而,一个容易被忽视的因素显著影响偏好强度的测量:人们对两个响应的态度可能不仅仅表示对其中一个的偏好,绑定现象也很常见。为此,我们提出采用广义Bradley-Terry模型——带绑定的Bradley-Terry模型 (BTT),以容纳绑定偏好,从而利用额外信息。我们证明,即便拥有提示和响应的真实分布,忽略绑定也会导致偏好强度测量中显著偏差。大量实验进一步验证了在偏好建模中纳入绑定的优势。值得注意的是,在包含绑定的合成偏好数据集上使用BTT进行微调显著优于在BT模型上进行微调,这些数据集由最先进的开源大语言模型标记。

关键词

引用

@article{arxiv.2410.05328,
  title  = {Reward Learning From Preference With Ties},
  author = {Jinsong Liu and Dongdong Ge and Ruihao Zhu},
  journal= {arXiv preprint arXiv:2410.05328},
  year   = {2024}
}