中文

通过模拟信任博弈揭示大语言模型中基于姓名的偏见

计算机与社会 2024-04-24 v1

摘要

从个人姓名中推断出的性别和种族是刻板印象和偏见的重要来源,它们潜移默化地影响着社会互动。来自人类实验的大量证据表明,当一个人的姓名暗示其属于主导性别或种族时,其会受到优待。随着大语言模型获得更多能力并开始支持日常应用,检验它们在复杂社会互动中遇到姓名时是否表现出类似偏见变得至关重要。与以往在词表示等更基础层面研究语言模型中基于姓名偏见的工作不同,我们挑战三个知名模型来预测修改后的信任博弈的结果,这是一种用于研究信任与互惠的广为人知的范式。为确保实验的内部效度,我们精心策划了一份具有种族代表性的姓氏列表,以在信任博弈中识别玩家,并严格验证了提示的结构效度。实验结果表明,我们的方法能够在基础模型和指令微调模型中检测到基于姓名的偏见。

关键词

引用

@article{arxiv.2404.14682,
  title  = {Uncovering Name-Based Biases in Large Language Models Through Simulated Trust Game},
  author = {Yumou Wei and Paulo F. Carvalho and John Stamper},
  journal= {arXiv preprint arXiv:2404.14682},
  year   = {2024}
}