社会选择应指导人工智能对齐以处理多样化的人类反馈
机器学习
2024-06-05 v2 人工智能
计算与语言
计算机与社会
计算机科学与博弈论
摘要
诸如GPT-4之类的基础模型经过微调以避免不安全或其他有问题的行为,例如帮助犯罪或生成种族主义文本。一种微调方法称为基于人类反馈的强化学习,它从人类对多个输出的明确偏好中学习。另一种方法是宪法人工智能,其中人类的输入是一系列高层次原则。但是,我们如何处理可能分歧的人类输入?如何将输入聚合成关于“集体”偏好的一致数据,或者以其他方式用于对模型行为做出集体选择?在本文中,我们认为社会选择领域非常适合解决这些问题,并基于2023年12月在美国加利福尼亚州伯克利举行的“社会选择促进人工智能伦理与安全”研讨会上的讨论,探讨了这一议程的前进方向。
关键词
引用
@article{arxiv.2404.10271,
title = {Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback},
author = {Vincent Conitzer and Rachel Freedman and Jobst Heitzig and Wesley H. Holliday and Bob M. Jacobs and Nathan Lambert and Milan Mossé and Eric Pacuit and Stuart Russell and Hailey Schoelkopf and Emanuel Tewolde and William S. Zwicker},
journal= {arXiv preprint arXiv:2404.10271},
year = {2024}
}
备注
15 pages, 4 figures