中文

通过贝叶斯方法使语言模型与人类偏好对齐

计算与语言 2024-01-17 v3

摘要

在推进以人为中心的自然语言生成(NLG)系统的过程中,确保NLG模型与人类偏好对齐至关重要。为此对齐,当前流行方法利用强化学习(RL)方法与基于人类反馈训练的奖励模型。然而,人类偏好主观本质导致的固有分歧给奖励模型训练带来重大挑战,致使NLG性能下降。为解决此问题,以往方法通常依赖多数投票或平均将多个不一致偏好合并为一个。尽管直观易懂且易执行,此类方法难以捕捉人类间细微的分歧程度,且可能仅代表特定子集个体,从而缺乏定量揭示人类偏好普遍性的能力。为应对该挑战,本文提出一种新方法,采用贝叶斯框架将人类偏好间分歧的分布纳入偏好模型训练,并命名为d-PM。此外,考虑到RL策略训练效率低且过程复杂,我们进一步提出利用对比学习策略,以d-PM模型得出的偏好分数训练NLG模型。在情感支持对话与诚信“经验法则”生成两项以人为中心的NLG任务上的大量实验表明,我们的方法在自动与人工评估中均持续超越以往SOTA模型。

关键词

引用

@article{arxiv.2310.05782,
  title  = {Aligning Language Models with Human Preferences via a Bayesian Approach},
  author = {Jiashuo Wang and Haozhao Wang and Shichao Sun and Wenjie Li},
  journal= {arXiv preprint arXiv:2310.05782},
  year   = {2024}
}

备注

NeurIPS 2023