中文

通过分布偏好奖励建模对齐群体反馈

人工智能 2024-05-31 v3

摘要

深度强化学习被广泛用于使大语言模型(LLM)与人类偏好对齐。然而,传统的奖励建模主要依赖于由特定人群提供的人工标注。这种依赖性可能会无意中导致模型产生偏差,仅反映这些标注者的倾向,从而无法充分代表更广泛人群的期望。我们提出了分布偏好奖励模型(DPRM),这是一个简单而有效的框架,旨在使大语言模型与多样化的人类偏好对齐。为此,我们通过分类分布来表征多种偏好,并引入贝叶斯更新器以适应偏移的或新的偏好。在此基础上,我们设计了一种基于最优传输的损失函数,以校准 DPRM 使其与偏好分布对齐。最后,利用期望奖励来微调 LLM 策略,以生成受人群青睐的回应。我们的实验表明,DPRM 显著增强了 LLM 与人群偏好的对齐,产生了更准确、无偏见且符合上下文的回应。

关键词

引用

@article{arxiv.2402.09764,
  title  = {Aligning Crowd Feedback via Distributional Preference Reward Modeling},
  author = {Dexun Li and Cong Zhang and Kuicai Dong and Derrick Goh Xin Deik and Ruiming Tang and Yong Liu},
  journal= {arXiv preprint arXiv:2402.09764},
  year   = {2024}
}