中文

词嵌入中存在哪些偏见?

计算与语言 2019-06-21 v4 机器学习

摘要

本文提出一种枚举词嵌入中偏见的算法。该算法在公开可用的嵌入(包括一个所谓的“去偏见”嵌入)上暴露出大量与种族、性别等敏感特征相关的冒犯性关联。鉴于词嵌入的广泛使用,这些偏见令人担忧。这些关联由词嵌入中在人名与常见小写词元之间平行分布的几何模式所识别。该算法高度无监督:甚至不需要预先指定敏感特征。这是可取的,因为:(a) 许多歧视形式——如种族歧视——关联到随语境变化的社会建构,而非具有固定定义的类别;(b) 它更易识别针对交叉群体(依赖于敏感特征组合)的偏见。我们算法的输入为目标词元列表(如人名)与词嵌入,输出若干捕获数据中各类偏见的词嵌入关联测试(WEATs)。我们在公开词嵌入与人名列表上阐明方法的效用,并通过众包评估其输出。我们还展示移除人名未必消除潜在的代理偏见。

关键词

引用

@article{arxiv.1812.08769,
  title  = {What are the biases in my word embedding?},
  author = {Nathaniel Swinger and Maria De-Arteaga and Neil Thomas Heffernan and Mark DM Leiserson and Adam Tauman Kalai},
  journal= {arXiv preprint arXiv:1812.08769},
  year   = {2019}
}

备注

At AIES 2019: the AAAI/ACM Conference on Artificial Intelligence, Ethics, and Society