迈向 RLHF 中的奖励公平性:基于资源分配的视角
机器学习
2025-11-12 v1 人工智能
摘要
奖励作为人类偏好的代理,在基于人类反馈的强化学习(RLHF)中起着至关重要的作用。然而,如果这些奖励本身存在缺陷并表现出各种偏差,它们将对大型语言模型(LLMs)的对齐产生不利影响。在本文中,我们将奖励中存在的各种偏差统一定义为奖励不公平问题。我们提出了一种与偏差无关的方法,从资源分配的角度解决奖励公平性问题,无需专门针对每种类型的偏差进行设计,即可有效缓解它们。具体而言,我们将偏好学习建模为资源分配问题,将奖励视为待分配的资源,同时考虑其分布中效用与公平性之间的权衡。我们提出了公平性正则化和公平性系数两种方法,以实现奖励的公平性。我们在验证和强化学习场景中应用了我们的方法,分别获得了公平奖励模型和策略模型。在这些场景下进行的实验表明,我们的方法以更公平的方式使 LLMs 与人类偏好对齐。
引用
@article{arxiv.2505.23349,
title = {Towards Reward Fairness in RLHF: From a Resource Allocation Perspective},
author = {Sheng Ouyang and Yulan Hu and Ge Chen and Qingyang Li and Fuzheng Zhang and Yong Liu},
journal= {arXiv preprint arXiv:2505.23349},
year = {2025}
}
备注
Accepted to ACL 2025