中文

RLHF 中基于分位数回归的分布式奖励模型

机器学习 2024-09-17 v1 人工智能 计算与语言

摘要

基于人类反馈的强化学习 (RLHF) 已成为通过奖励模型将大型语言模型 (LLM) 与人类偏好对齐的关键方法。然而,传统的奖励模型通常生成点估计,这简化了人类价值观和偏好的多样性与复杂性。在本文中,我们引入了分位数奖励模型 (QRM),这是一种新颖的奖励建模方法,它学习奖励的分布而非单一标量值。我们的方法使用分位数回归来估计完整的、可能是多峰的偏好分布,提供了更强大且更细致的偏好表示。这种分布式方法能够更好地捕捉人类价值观的多样性,解决标签噪声问题,并通过将冲突的偏好建模为分布中的不同模态来容纳这些偏好。我们的实验结果表明,QRM 在 RewardBench 上优于同类的传统点估计模型。此外,我们证明了分布式估计提供的额外信息可用于下游应用,例如风险感知强化学习,从而使 LLM 策略生成更少的极端负面回复。我们的代码和模型已发布于 https://github.com/Nicolinho/QRM。

关键词

引用

@article{arxiv.2409.10164,
  title  = {Quantile Regression for Distributional Reward Models in RLHF},
  author = {Nicolai Dorka},
  journal= {arXiv preprint arXiv:2409.10164},
  year   = {2024}
}