中文

将社会选择理论映射到RLHF

人工智能 2024-04-22 v1 计算机与社会

摘要

近期关于使用人类反馈强化学习(RLHF)将人类偏好纳入模型行为的局限性的研究,经常将社会选择理论作为参考点。社会选择理论对投票机制等场景的分析提供了技术基础设施,可以为如何在分歧中聚合人类偏好提供参考。我们分析了社会选择和RLHF的问题设定,找出了它们之间的关键差异,并讨论了这些差异可能如何影响RLHF对社会选择中著名技术结果的解释。

关键词

引用

@article{arxiv.2404.13038,
  title  = {Mapping Social Choice Theory to RLHF},
  author = {Jessica Dai and Eve Fleisig},
  journal= {arXiv preprint arXiv:2404.13038},
  year   = {2024}
}