将社会选择理论映射到RLHF
人工智能
2024-04-22 v1 计算机与社会
摘要
近期关于使用人类反馈强化学习(RLHF)将人类偏好纳入模型行为的局限性的研究,经常将社会选择理论作为参考点。社会选择理论对投票机制等场景的分析提供了技术基础设施,可以为如何在分歧中聚合人类偏好提供参考。我们分析了社会选择和RLHF的问题设定,找出了它们之间的关键差异,并讨论了这些差异可能如何影响RLHF对社会选择中著名技术结果的解释。
引用
@article{arxiv.2404.13038,
title = {Mapping Social Choice Theory to RLHF},
author = {Jessica Dai and Eve Fleisig},
journal= {arXiv preprint arXiv:2404.13038},
year = {2024}
}