去偏 GPT 模型中持续存在的穆斯林-暴力偏见
计算与语言
2023-12-13 v2
摘要
Abid 等人(2021)表明,与对其他宗教的提示相比,GPT-3 在收到关于穆斯林的提示时倾向于生成 mostly 暴力续写。两次预注册重复尝试发现,在较新的 InstructGPT(经过微调以消除有偏和有毒输出)中暴力续写很少,且仅存在微弱的反穆斯林偏见。然而,更多预注册实验表明,在提示中使用与宗教相关的常见名字会使暴力续写率增加数倍,揭示出显著的二阶反穆斯林偏见。ChatGPT 表现出强许多倍的偏见,无论提示格式如何,这表明随着模型持续开发,去偏效果被削弱。我们的内容分析揭示了所有实验中包含冒犯性刻板印象的宗教特定主题。我们的结果显示,需要以能同时处理显式与高阶关联的方式对模型进行持续去偏。
引用
@article{arxiv.2310.18368,
title = {Muslim-Violence Bias Persists in Debiased GPT Models},
author = {Babak Hemmatian and Razan Baltaji and Lav R. Varshney},
journal= {arXiv preprint arXiv:2310.18368},
year = {2023}
}
备注
2 pages, 2 figures. This work will be presented at MusIML neurips workshop