中文

基于多角色辩论反馈的强化学习用于LLM偏差缓解

人工智能 2024-08-19 v6

摘要

LLM中的偏差可能损害用户体验和社会结果。然而,当前的偏差缓解方法通常需要大量人工反馈,缺乏对其他主题的可迁移性,或产生过于自信和随机的输出。我们发现让LLM参与角色扮演场景能提升其识别和缓解偏差的能力。基于此,我们提出了基于多角色辩论反馈的强化学习(RLDF),一种替代传统RLHF中人工反馈的偏差缓解新方法。我们利用LLM进行多角色辩论,创建包含高偏差和低偏差实例的数据集,用于训练强化学习中的奖励模型。我们的方法包含两种模式:(1)自反思,即同一LLM参与多角色辩论;(2)师生模式,即更先进的LLM(如GPT-3.5-turbo)引导LLM执行此任务。在BBQ和我们的数据集上对不同LLM进行的实验结果表明了我们的方法在偏差缓解方面的有效性。我们的源代码和数据集可在\texttt{https://anonymous.4open.science/r/RLDF-E344}获取。

关键词

引用

@article{arxiv.2404.10160,
  title  = {Reinforcement Learning from Multi-role Debates as Feedback for Bias Mitigation in LLMs},
  author = {Ruoxi Cheng and Haoxuan Ma and Shuirong Cao and Jiaqi Li and Aihua Pei and Zhiqiang Wang and Pengliang Ji and Haoyu Wang and Jiaqi Huo},
  journal= {arXiv preprint arXiv:2404.10160},
  year   = {2024}
}

备注

The first three authors contributed equally to this work