个性化随机鹦鹉更危险吗?评估对话系统中的人格偏见
计算与语言
2023-11-06 v5 人工智能
摘要
大型语言模型(LLM)近期的进展使其能遵循自由形式的指令,包括在对话中模仿通用或特定的人口统计人格(persona)。我们定义通用人格来代表人口统计群体,如“一个亚洲人”,而特定人格可能采用特定的流行亚洲名字形式,如“Yumi”。尽管人格的采用通过使对话系统更具吸引力和亲和力而丰富了用户体验,但也因加剧模型回复中的社会偏见而投下潜在风险的阴影,从而通过与用户的交互造成社会危害。本文系统性地研究“人格偏见”,我们将其定义为对话模型的有害行为对其所采用人格的敏感性。我们将人格偏见分为有害表达偏见与有害认同偏见,并建立了一个综合评估框架,从五个方面衡量人格偏见:攻击性、毒性续写、评价(regard)、刻板印象认同与毒性认同。此外,我们提出通过实验UNIVERSALPERSONA来研究人格偏见,这是一个系统性构建的人格数据集,涵盖各类通用与特定模型人格。通过在四个不同模型(包括Blender、ChatGPT、Alpaca和Vicuna)上的基准测试,我们的研究揭示了对话系统中显著的人格偏见。我们的发现也强调了重新审视对话智能体中人格使用的迫切需求,以确保安全应用。
引用
@article{arxiv.2310.05280,
title = {Are Personalized Stochastic Parrots More Dangerous? Evaluating Persona Biases in Dialogue Systems},
author = {Yixin Wan and Jieyu Zhao and Aman Chadha and Nanyun Peng and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2310.05280},
year = {2023}
}