酷儿者首先是人:解构大语言模型中的性身份刻板印象
计算与语言
2023-07-04 v1 人工智能
摘要
大语言模型(LLMs)主要在 minimally processed 的网络文本上训练,这些文本表现出创作该内容的人类所持有的同样广泛的社会偏见。因此,LLM 生成的文本可能无意中延续对边缘化群体(如 LGBTQIA+ 社群)的刻板印象。在本文中,我们对 LLM 如何生成描述不同性身份人物的文本进行了比较研究。利用 regard score 分析 LLM 生成文本中的偏见,显示出对酷儿群体的可测量偏见。我们随后展示,一种基于使用 SHAP 分析的思维链提示的后处理方法能够提高句子的 regard,代表了一种在此场景下对 LLM 输出去偏的有前景方法。
引用
@article{arxiv.2307.00101,
title = {Queer People are People First: Deconstructing Sexual Identity Stereotypes in Large Language Models},
author = {Harnoor Dhingra and Preetiha Jayashanker and Sayali Moghe and Emma Strubell},
journal= {arXiv preprint arXiv:2307.00101},
year = {2023}
}
备注
Accepted to Queer in AI Workshop at ACL 2023