中文

利用平滑一阶共现从文本语料库中测量社会偏见

计算与语言 2021-04-28 v4 机器学习 机器学习

摘要

文本语料库是测量社会偏见和刻板印象的广泛使用的资源。使用语料库测量此类偏见的常用方法是计算某个词(如护士)的嵌入向量与感兴趣概念(如性别)的代表词向量之间的相似度。在本研究中,我们表明,根据人们旨在量化的偏见内容,这种常用的方法可能会将无关概念引入偏见测量中。我们提出了一种替代的偏见测量方法,利用词与代表概念词之间的平滑一阶共现关系,这是通过重构词嵌入模型中固有的共现估计推导出来的。我们根据英语维基百科语料库,在测量职业词汇性别偏见的场景下进行了多项实验来比较这些方法。我们的实验表明,与基于向量相似度的方法相比,使用一阶方法测得的性别偏见与美国就业市场的实际性别偏见统计数据具有更高的相关性——这在两个语料集和多种词嵌入模型上均成立。在少数特定职业中,一阶方法还表明其比其他方法表现出更严重的女性偏见。

关键词

引用

@article{arxiv.1812.10424,
  title  = {Measuring Societal Biases from Text Corpora with Smoothed First-Order Co-occurrence},
  author = {Navid Rekabsaz and Robert West and James Henderson and Allan Hanbury},
  journal= {arXiv preprint arXiv:1812.10424},
  year   = {2021}
}

备注

In proceedings of the International AAAI Conference on Web and Social Media (ICWSM) 2021