中文

谁更擅长数学?探寻大语言模型中的偏见

计算与语言 2024-10-10 v3 计算机与社会

摘要

大语言模型(LLMs)已被证明会传播并放大有害偏见,尤其是对边缘化社区造成的偏见。为更全面地理解这些偏见的影响,我们引入 GlobalBias 数据集,包含 876k 句子,涵盖 40 个不同性别-族裔组合,以及偏见文献中通常使用的描述符,使我们能够从世界各地广泛研究各种偏见。我们使用 GlobalBias 直接探测多种语言模型,通过困惑度作为代理来确定某些偏见在模型内部表示中的程度。随后,我们基于给定姓名生成角色轮廓,并评估模型输出中偏见的普遍性。我们发现,与各种偏见相关的民族群体在模型概率和模型输出中保持一致。此外,更大的模型持续显示更高的偏向性输出,即使明确指示不要这样做。

关键词

引用

@article{arxiv.2407.06917,
  title  = {Who is better at math, Jenny or Jingzhen? Uncovering Stereotypes in Large Language Models},
  author = {Zara Siddique and Liam D. Turner and Luis Espinosa-Anke},
  journal= {arXiv preprint arXiv:2407.06917},
  year   = {2024}
}

备注

Accepted to EMNLP Main 2024