名字又何妨? auditing 大语言模型种族和性别偏见
计算与语言
2025-01-27 v3 人工智能
计算机与社会
机器学习
摘要
我们采用审计设计来调查最先进的大语言模型,包括 GPT-4,是否存在种族和性别偏见。在我们的研究中,我们对模型进行提示,让它们就涉及具名个体的各种情境提供建议,例如在购车谈判中或预测选举结果时。在我们看来,建议系统性地不利于与种族少数派和女性相关联的名字。在我们看来,与黑人女性相关联的名字获得的最不利的结果最为明显。这些偏见在42个提示模板和多个模型中均保持一致,这表明这是一个系统性问题,而非孤立事件。虽然在提示中提供数值、与决策相关的锚点可以成功抵消这些偏见,但定性细节效果不一致,甚至可能加剧差异。我们的发现强调了在大语言模型部署和实施时进行审计的重要性,以减轻其对被边缘化社区的潜在伤害。
引用
@article{arxiv.2402.14875,
title = {What's in a Name? Auditing Large Language Models for Race and Gender Bias},
author = {Alejandro Salinas and Amit Haim and Julian Nyarko},
journal= {arXiv preprint arXiv:2402.14875},
year = {2025}
}
备注
62 pages, 34 tables, 16 figures