中文

聊天机器人中的第一人称公平性

计算机与社会 2025-03-04 v2 人工智能 计算与语言

摘要

评估聊天机器人的公平性至关重要,鉴于其快速普及,然而典型的聊天机器人任务(如简历撰写、娱乐)与机构决策任务(如简历筛选)等有所不同,这些任务是算法公平性讨论的中心。聊天机器人的开放性和多样化用例使得新方法的偏差评估成为必要。这篇论文通过引入一种可扩展的反事实方法来评估“第一人称公平性”,即就基于人口统计特征对聊天机器人用户的公平性进行评估。我们的方法使用语言模型作为研究助手 (LMRA) 以量化有害偏见和对人口统计差异的定性分析。我们将此方法应用于评估我们六个语言模型中的偏见,覆盖数百万次交互,涵盖六十六项任务,九个领域,涵盖两种性别和四种种族。独立的人类标注证实了 LMRA 生成的偏见评估。这项研究代表了基于真实世界聊天数据进行的大规模公平性评估。我们指出,后训练强化学习技术显著减轻了这些偏见。这一评估提供了一种实用的方法,用于持续的偏见监控和缓解。

关键词

引用

@article{arxiv.2410.19803,
  title  = {First-Person Fairness in Chatbots},
  author = {Tyna Eloundou and Alex Beutel and David G. Robinson and Keren Gu-Lemberg and Anna-Luisa Brakman and Pamela Mishkin and Meghan Shah and Johannes Heidecke and Lilian Weng and Adam Tauman Kalai},
  journal= {arXiv preprint arXiv:2410.19803},
  year   = {2025}
}

备注

In ICLR 2025, 59 pages, 27 figures