自由放任的危害:生成式语言模型中的算法偏见
计算与语言
2026-05-04 v2 人工智能
计算机与社会
机器学习
摘要
生成式语言模型的快速部署引发了人们对社会偏见影响不同消费者福祉的担忧。现有关于生成式语言模型的文献主要通过显式身份提示来检验偏见。然而,早期关于语言技术平台(包括搜索引擎)偏见的研究表明,即使没有明确指定身份术语,歧视也可能发生。对于开放式提示(其中身份分类未指定)的语言模型响应中的偏见研究尚缺乏,且尚未基于最终消费者的伤害。在这里,我们通过开放式提示考虑更广泛的自然使用案例,推进了生成式语言模型偏见的研究。在这种“自由放任”的设置中,我们发现来自五种最普遍的语言模型(ChatGPT3.5、ChatGPT4、Claude2.0、Llama2和PaLM2)的合成文本对具有交叉种族、性别和/或性取向身份的少数群体(AI/AN、Asian、Black、Latine、MENA、NH/PI、Female、Non-binary、Queer)延续了遗漏、从属和刻板印象的伤害。我们发现了广泛的偏见证据,以至于这些个体遇到语言模型生成的输出以从属方式描绘其身份的可能性比代表性或赋权性描绘高出数百到数千倍。我们还记录了语言模型生成输出中刻板印象(例如永久外国人)的普遍存在,这些刻板印象已知会引发心理伤害,对少数群体影响尤为严重。这些包括刻板印象威胁,导致认知能力下降和消极自我认知增加。我们的发现强调了迫切需要保护消费者免受语言模型造成的歧视性伤害,并投资于针对赋权多样化消费者的关键AI教育项目。
引用
@article{arxiv.2404.07475,
title = {Laissez-Faire Harms: Algorithmic Biases in Generative Language Models},
author = {Evan Shieh and Faye-Marie Vassel and Cassidy Sugimoto and Thema Monroe-White},
journal= {arXiv preprint arXiv:2404.07475},
year = {2026}
}
备注
16 pages (43 if including supplementals), 8 figures (23 if including supplementals)