理解词嵌入中偏见的起源
机器学习
2019-06-11 v2 计算机与社会
机器学习
摘要
机器学习系统的力量不仅预示着巨大的技术进步,也带来了社会危害的风险。作为近期的一个例子,研究人员已表明流行的词嵌入算法表现出刻板偏见,例如性别偏见。这些算法在从自动翻译服务到简历扫描器的机器学习系统中的广泛使用,可能在重要情境中放大刻板印象。尽管已经开发出测量这些偏见并修改词嵌入以减轻其偏见表示的方法,但对于词嵌入偏见如何依赖于训练数据仍缺乏理解。在这项工作中,我们开发了一种理解词嵌入中偏见起源的技术。给定在语料库上训练的词嵌入,我们的方法识别扰动该语料库将如何影响所得嵌入的偏见。这可用于将词嵌入偏见的起源追溯至原始训练文档。使用我们的方法,可以调查底层语料库偏见的趋势,并识别出移除后最能减少偏见的文档子集。我们在《纽约时报》和维基百科语料库上演示了我们的技术,发现基于影响函数的近似非常准确。
引用
@article{arxiv.1810.03611,
title = {Understanding the Origins of Bias in Word Embeddings},
author = {Marc-Etienne Brunet and Colleen Alkalay-Houlihan and Ashton Anderson and Richard Zemel},
journal= {arXiv preprint arXiv:1810.03611},
year = {2019}
}