中文

对话式 AI 安全中的交叉性:贝叶斯多层模型如何帮助理解多样化的安全感知

人机交互 2023-06-21 v1

摘要

对话式 AI 系统展现出一定程度的类人行为,有望对日常生活的许多方面产生深远影响——人们如何获取信息、创建内容以及寻求社会支持。然而,这些模型也表现出偏见、冒犯性语言和传递虚假信息的倾向。因此,理解和审核这些模型中的安全风险是一项关键的技术和社会挑战。安全感知本质上是主观的,其中许多因素——通常是交叉的——可以决定为什么一个人可能认为与聊天机器人的对话是安全的,而另一个人可能认为同一对话是不安全的。在本工作中,我们关注可能影响这种多样化感知的人口统计学因素。为此,我们贡献了一项使用贝叶斯多层建模的分析,以探索评分者人口统计学特征与评分者如何报告对话式 AI 系统安全性之间的联系。我们研究了一个由 252 名人类评分者组成的样本,按性别、年龄段、种族/族裔群体和地区进行了分层。该评分者池为 1,340 次人机对话提供了安全标签。我们的结果表明,涉及种族/族裔、性别和年龄等人口统计学特征以及内容特征(如危害程度)的交叉效应,在决定对话式 AI 系统的安全性方面均起着重要作用。例如,种族/族裔和性别显示出强烈的交叉效应,特别是在南亚和东亚女性中。我们还发现,对话的危害程度影响所有种族/族裔群体的评分者,但原住民和南亚评分者对此危害尤为敏感。最后,我们观察到教育的影响对原住民评分者具有独特的交叉性,突显了多层框架在揭示代表性不足的社会观点方面的效用。

关键词

引用

@article{arxiv.2306.11530,
  title  = {Intersectionality in Conversational AI Safety: How Bayesian Multilevel Models Help Understand Diverse Perceptions of Safety},
  author = {Christopher M. Homan and Greg Serapio-Garcia and Lora Aroyo and Mark Diaz and Alicia Parrish and Vinodkumar Prabhakaran and Alex S. Taylor and Ding Wang},
  journal= {arXiv preprint arXiv:2306.11530},
  year   = {2023}
}