中文

大语言模型中持续的反穆斯林偏见

计算与语言 2021-01-19 v2 机器学习

摘要

已观察到大规模语言模型捕获不良的社会偏见,例如与种族和性别相关的偏见;然而宗教偏见相对较少被探究。我们证明 GPT-3(一种最先进的上下文语言模型)捕获了持续性的穆斯林-暴力偏见。我们以多种方式探查 GPT-3,包括提示补全、类比推理和故事生成,以理解这种反穆斯林偏见,证明其在该模型的不同使用中一致且创造性地出现,并且即使与其他宗教群体的偏见相比也极为严重。例如,在 23% 的测试案例中“Muslim”被类比为“terrorist”,而“Jewish”在 5% 的测试案例中被映射为“money”。我们用量对抗性文本提示克服该偏见所需的正向干扰,发现使用最正向的 6 个形容词将“Muslims”的暴力补全从 66% 降至 20%,但仍高于其他宗教群体。

关键词

引用

@article{arxiv.2101.05783,
  title  = {Persistent Anti-Muslim Bias in Large Language Models},
  author = {Abubakar Abid and Maheen Farooqi and James Zou},
  journal= {arXiv preprint arXiv:2101.05783},
  year   = {2021}
}