标记人格:利用自然语言提示度量语言模型中的刻板印象
计算与语言
2023-05-30 v1 人工智能
计算机与社会
摘要
为认识并缓解大语言模型(LLMs)带来的危害,我们需要理解 LLM 输出中刻板印象的普遍程度与细微差别。为此,我们提出 Marked Personas,一种基于提示的方法,可在无需任何词典或数据标注的情况下,度量 LLM 中关于交叉性人口群体的刻板印象。基于社会语言学中的标记性(markedness)概念(其刻画了显式语言标记的类别与未标记默认类别),我们提出的方法包含两方面:1)提示 LLM 生成目标人口群体的 personas(即自然语言描述),同时生成未标记默认群体的 personas;2)识别显著区分目标群体 personas 与相应未标记 personas 的词语。我们发现,GPT-3.5 和 GPT-4 生成的刻画包含比使用相同提示的人工撰写刻画更高的种族刻板印象比率。区分标记(非白人、非男性)群体 personas 的词语反映出将这些人口群体他者化与异域化的模式。交叉性视角进一步揭示了主导边缘群体刻画的固有套路,如热带主义与少数族裔女性的过度性化。这些代表性危害对故事生成等下游应用具有令人担忧的启示。
引用
@article{arxiv.2305.18189,
title = {Marked Personas: Using Natural Language Prompts to Measure Stereotypes in Language Models},
author = {Myra Cheng and Esin Durmus and Dan Jurafsky},
journal= {arXiv preprint arXiv:2305.18189},
year = {2023}
}
备注
To appear at ACL 2023, 9 pages, 3 figures, 3 tables