中文

基于个人化与偏好聚合的异构反馈 RLHF

人工智能 2024-05-28 v2 机器学习

摘要

从人类反馈中进行强化学习(RLHF)是一种有效的技术,已在微调大型语言模型方面取得显著成功。目前大多数 RLHF 范式都假设人类偏好相对一致,可由单一奖励模型编码。本文聚焦于解决由于人类偏好内在异构性以及其潜在的战略行为在提供反馈方面的问题。具体而言,我们提出两种框架以原则性方式解决异构人类反馈:基于个人化的方案和基于聚合的方案。对于前者,我们分别提出两种基于表示学习和聚类的方法,用于学习多个奖励模型,以在偏好异构性带来的偏差和由于个人化导致每个模型数据较少的方差之间进行权衡。我们为两种方法建立了样本复杂度保证。对于后者,我们旨在遵循当前 RLHF 范式中所采用的单模型框架,通过仔细聚合来自人类的多样化且真实的偏好。我们提出两种基于奖励和偏好聚合的方法:前者利用功利主义和 Leximin 方法聚合 individual reward models,并给出样本复杂度保证;后者直接以概率意见形式聚合人类反馈。在概率意见反馈模型下,我们还发展了一种处理可能偏离和操纵聚合偏好的战略人类标注者的方法。基于机制设计的思想,我们的方法确保了真实的偏好报告,并使所诱导的聚合规则最大化社会福利函数。

关键词

引用

@article{arxiv.2405.00254,
  title  = {RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation},
  author = {Chanwoo Park and Mingyang Liu and Dingwen Kong and Kaiqing Zhang and Asuman Ozdaglar},
  journal= {arXiv preprint arXiv:2405.00254},
  year   = {2024}
}

备注

Added experiments