中文

从语言语料库自动导出的语义包含类人偏差

人工智能 2017-05-26 v4 计算与语言 计算机与社会 机器学习

摘要

人工智能和机器学习正处于惊人的增长期。然而,有人担心这些技术可能被有意或无意地用于延续偏见和不公,而这些偏见和不公不幸地是许多人类制度的特征。我们在此首次证明,将标准机器学习应用于普通语言——即人类日常接触的同类语言——会产生类人的语义偏差。我们复现了内隐联想测验及其他著名心理学研究所揭示的一系列标准人类偏差。我们使用了一个广泛应用的纯统计机器学习模型——即 GloVe 词嵌入——在来自 Web 的文本语料库上进行训练,复现了这些偏差。我们的结果表明,语言本身包含着我们历史偏差的可恢复且精确的印记,无论这些偏差在道德上是中性的(如对昆虫或花卉),还是有问题的(如对种族或性别),抑或仅仅是真实的,反映了职业或名字方面性别分布的{\em 现状}。这些规律性被机器学习连同语义的其余部分一并捕获。除了关于语言的实证发现外,我们还贡献了评估文本偏差的新方法:词嵌入关联测验(WEAT)和词嵌入事实关联测验(WEFAT)。我们的结果不仅对 AI 和机器学习有启示,对心理学、社会学和人类伦理学领域也有影响,因为它们提出了一种可能性,即仅仅接触日常语言就可以解释我们在此复现的偏差。

关键词

引用

@article{arxiv.1608.07187,
  title  = {Semantics derived automatically from language corpora contain human-like biases},
  author = {Aylin Caliskan and Joanna J. Bryson and Arvind Narayanan},
  journal= {arXiv preprint arXiv:1608.07187},
  year   = {2017}
}

备注

14 pages, 3 figures