评估上下文词表示中的社会与交叉身份偏见
计算与语言
2019-11-06 v1 人工智能
计算机与社会
机器学习
机器学习
摘要
机器学习中的社会偏见已引起显著关注,相关工作涵盖从展示多种应用中的偏见、为不同情境界定公平性定义,到开发缓解偏见的算法。在自然语言处理中,性别偏见已被证明存在于上下文无关词嵌入中。近来,上下文词表示在若干下游 NLP 任务中优于词嵌入。这些词表示以句中上下文为条件,也可用于编码整个句子。本文中,我们分析最先进的上下文词表示模型(如 BERT 和 GPT-2)在多大程度上编码了关于性别、种族及交叉身份的偏见。为此,我们提出在上下文词层面评估偏见。这一新方法捕捉了上下文无关词嵌入所缺失的偏见上下文效应,同时避免了句子编码层面低估偏见的混淆效应。我们展示了语料层面的偏见证据,在嵌入关联测试中发现了不同程度的偏见证据,特别指出种族偏见在上下文词模型中被强烈编码,并观察到交叉少数群体的偏见效应超出其组成少数身份之和。此外,在上下文词层面评估偏见效应捕捉到了句子层面未能捕捉的偏见,印证了我们所提新方法的必要性。
引用
@article{arxiv.1911.01485,
title = {Assessing Social and Intersectional Biases in Contextualized Word Representations},
author = {Yi Chern Tan and L. Elisa Celis},
journal= {arXiv preprint arXiv:1911.01485},
year = {2019}
}
备注
NeurIPS 2019