中文

方言偏见预测 AI 关于人的性格、就业能力和犯罪性的决策

计算与语言 2024-03-04 v1 人工智能 计算机与社会

摘要

如今,数亿人与语言模型互动,其用途 ranging from 作为写作辅助到影响招聘决策。然而,这些语言模型已知会延续系统性的种族偏见,使其对非裔美国人等群体的判断以有问题的方式产生偏差。虽然先前的研究集中在语言模型中的公然种族主义,但社会科学家认为,具有更微妙特征的种族主义已随时间发展。目前尚不清楚这种隐性种族主义是否体现在语言模型中。在此,我们证明语言模型以方言偏见的形式体现了隐性种族主义:我们扩展了研究表明美国人对非裔美国英语 (African American English) 使用者持有种族语言刻板印象,并发现语言模型具有相同的偏见,表现出比任何实验记录过的关于非裔美国人的显性人类刻板印象都更负面的隐性刻板印象,尽管最接近民权运动之前的那些。相比之下,语言模型对非裔美国人的显性刻板印象要正面得多。我们通过要求语言模型仅根据人们的说话方式来做出关于他们的假设性决策,证明了方言偏见具有造成有害后果的潜力。语言模型更有可能建议非裔美国英语使用者被分配声望较低的工作、被判有罪并被判处死刑。最后,我们表明,现有的减轻语言模型种族偏见的方法(如人类反馈训练)并不能缓解方言偏见,反而可能加剧隐性和显性刻板印象之间的差异,因为它们教导语言模型在表面上掩盖其在更深层次上维持的种族主义。我们的发现对语言技术的公平和安全应用具有深远影响。

关键词

引用

@article{arxiv.2403.00742,
  title  = {Dialect prejudice predicts AI decisions about people's character, employability, and criminality},
  author = {Valentin Hofmann and Pratyusha Ria Kalluri and Dan Jurafsky and Sharese King},
  journal= {arXiv preprint arXiv:2403.00742},
  year   = {2024}
}