谁的偏好?公平性偏好差异及其对基于人类反馈的 AI 公平性影响
机器学习
2024-06-11 v1 人工智能
计算与语言
计算机与社会
摘要
关于从人类反馈中学习以将机器学习系统的各个方面与人类价值观和偏好相匹配的工作呈快速增长。我们考虑的是内容 moderation 中的公平性问题,即使用人类反馈来确定两种评论——引用不同敏感属性组——应如何相互比较。我们收集了一个来自 Prolific 和 MTurk 的新型数据集,发现根据评论者的种族、年龄、政治立场、教育水平和 LGBTQ+ 身份,公平性偏好存在显著差异。我们也表明,文本中提及的属性对用户如何感知 individual fairness 在 moderation 中有强大的影响。进一步,我们发现差异也存在于训练来预测人类偏好的下游分类器中。最后,我们观察到,给予来自不同人口统计学分组注释的分类器 Equal weight 的集成,对不同的人口统计学交叉口的表现更好;相对于赋予每个注释 Equal weight 的单个分类器。
关键词
引用
@article{arxiv.2406.05902,
title = {Whose Preferences? Differences in Fairness Preferences and Their Impact on the Fairness of AI Utilizing Human Feedback},
author = {Emilia Agis Lerner and Florian E. Dorner and Elliott Ash and Naman Goel},
journal= {arXiv preprint arXiv:2406.05902},
year = {2024}
}
备注
To appear in the Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics, ACL 2024