中文

微调语言模型以寻找具有多元偏好人群间的共识

机器学习 2022-11-29 v1 计算与语言

摘要

大语言模型(LLMs)近期的相关工作利用微调将输出与典型用户的偏好对齐。这类工作假设人类偏好是静态的且在个体间同质的,从而对齐单一“通用”用户即可带来更普遍的对齐。在此,我们接纳人类偏好的异质性,考量一个不同挑战:机器如何帮助持不同观点的人们找到共识?我们微调了一个700亿参数的LLM,以生成使一群可能持不同意见者期望认可度最大化的陈述。人类参与者就数千个涉及道德与政治议题(如“是否应提高对富人的税收?”)的问题提供书面意见,并对LLM生成的候选共识陈述就一致性与质量打分。随后训练一个奖励模型来预测个体偏好,使其能依据不同聚合(社会福利)函数,按对整体群体的吸引力对共识陈述进行量化与排序。该模型生成的共识陈述被人类用户偏好于提示型LLM的输出(>70%),并显著优于缺少最终排序步骤的紧凑微调基线。此外,我们最佳模型的共识陈述被偏好于最佳人工生成意见(>65%)。我们发现,当我们仅从部分群体成员静默构建共识陈述时,被排除者更可能持异议,揭示了共识对个人贡献的敏感性。这些结果凸显了利用LLMs帮助人类群体相互对齐价值的潜力。

关键词

引用

@article{arxiv.2211.15006,
  title  = {Fine-tuning language models to find agreement among humans with diverse preferences},
  author = {Michiel A. Bakker and Martin J. Chadwick and Hannah R. Sheahan and Michael Henry Tessler and Lucy Campbell-Gillingham and Jan Balaguer and Nat McAleese and Amelia Glaese and John Aslanides and Matthew M. Botvinick and Christopher Summerfield},
  journal= {arXiv preprint arXiv:2211.15006},
  year   = {2022}
}