硅顶:审计 GPT 在招聘中的种族与性别偏见
计算机与社会
2024-11-18 v3 计算与语言
摘要
大型语言模型(LLM)日益被引入职场场景,旨在提高效率和公平性。然而,这些模型反映或加剧社会偏见和刻板印象的潜在风险引发了关切。本研究探讨了 LLM 对招聘实践的潜在影响。为此,我们对一种常用 LLM——OpenAI 的 GPT-3.5 的种族与性别偏见进行 AI 审计,借鉴了传统线下简历审计的历史方法。我们进行了两项研究,使用具有不同种族与性别 connotation 的姓名:简历评估(研究 1)和简历生成(研究 2)。在研究 1 中,我们要求 GPT 对 32 个不同姓名(每个性别与种族组合 4 个姓名)以及两个匿名选项的简历进行评分,涵盖 10 个职位和 3 个评估任务(整体评分、意愿访谈和可雇用性)。我们发现,该模型反映了基于刻板印象的某些偏见。在研究 2中,我们要求 GPT 为虚构的求职者生成简历(每个姓名 10 个)。在生成简历时,GPT 揭示了底层偏见;女性简历的职位经验较少,而亚裔和西班牙裔简历则包含移民标记,如非母语和非美国教育与工作经历。我们的发现为 LLM 在职场语境中的偏见研究 contribute to a growing body of literature on LLM biases。
引用
@article{arxiv.2405.04412,
title = {The Silicon Ceiling: Auditing GPT's Race and Gender Biases in Hiring},
author = {Lena Armstrong and Abbey Liu and Stephen MacNeil and Danaë Metaxa},
journal= {arXiv preprint arXiv:2405.04412},
year = {2024}
}