检测涌现的交叉性偏见:上下文词嵌入包含类人的偏见分布
计算机与社会
2021-05-20 v5 人工智能
计算与语言
摘要
以隐含的人类偏见反映于语言的统计规律为出发点,可以度量英语静态词嵌入中的偏见。最先进的神经语言模型生成依赖于词出现语境的动态词嵌入。现有方法度量由句子模板定义的特定语境中出现的预定义社会与交叉性偏见。我们摒弃模板,引入上下文嵌入关联检验(CEAT),其通过纳入随机效应模型来总结神经语言模型中总体偏见的量级。关于社会与交叉性偏见的实验表明,CEAT 发现了所有被检验偏见的证据,并提供关于同一偏见在不同语境中效应量级方差的全面信息。我们所研究的全部在英语语料上训练的模型都包含有偏表示。此外,我们发展了两种方法,交叉性偏见检测(IBD)与涌现交叉性偏见检测(EIBD),以自动识别静态词嵌入中的交叉性偏见与涌现交叉性偏见,并度量其在上下文嵌入中的程度。我们给出了首个算法偏见检测发现,表明交叉群体成员如何被强烈关联到与其组成少数身份偏见不重叠的独特涌现偏见。IBD 与 EIBD 在检测非裔美国女性与墨西哥裔美国女性的交叉性与涌现偏见时达到高准确率。我们的结果表明,与多少数群体成员(如非裔美国女性与墨西哥裔美国女性)相关的种族与性别交叉处的偏见,在所有神经语言模型中具有最高量级。
引用
@article{arxiv.2006.03955,
title = {Detecting Emergent Intersectional Biases: Contextualized Word Embeddings Contain a Distribution of Human-like Biases},
author = {Wei Guo and Aylin Caliskan},
journal= {arXiv preprint arXiv:2006.03955},
year = {2021}
}
备注
19 pages, 2 figures, 4 tables