去偏后的大语言模型仍会将穆斯林与独特的暴力行为相关联
计算与语言
2022-08-11 v2 人工智能
摘要
近期研究表明,与基督徒和印度教徒相比,GPT-3 模型在涉及穆斯林的提示下倾向于生成暴力文本补全。两次预先注册的复现尝试(一次精确、一次近似)发现,在经微调以消除偏倚和有毒输出的较新 Instruct 系列版 GPT-3 中,仅存在最微弱的偏倚。观察到的暴力补全很少。然而,额外的预先注册实验表明,在提示中使用与这些宗教相关的常见名字会导致暴力补全显著增加,且揭示出针对穆斯林更强的二阶偏倚。来自非暴力领域的穆斯林名人名字导致的暴力补全相对较少,这表明获取个体化信息可使模型避免套用刻板印象。尽管如此,内容分析显示,无论提示格式如何,都出现了包含高度冒犯性观点的宗教特定暴力主题。我们的结果表明,需要对大语言模型进行额外的去偏,以解决高阶图式与关联问题。
引用
@article{arxiv.2208.04417,
title = {Debiased Large Language Models Still Associate Muslims with Uniquely Violent Acts},
author = {Babak Hemmatian and Lav R. Varshney},
journal= {arXiv preprint arXiv:2208.04417},
year = {2022}
}
备注
6 pages, 1 figure, 3 tables