中文

命名实体识别中的人口统计偏差评估

计算与语言 2020-08-11 v1 计算机与社会 信息检索 机器学习

摘要

命名实体识别(NER)通常是从原始文本自动生成知识库(KB)的第一步。在这项工作中,我们使用合成生成的语料库,评估了多种英语命名实体识别(NER)系统在不同人口统计群体上的偏差。我们的分析表明,在两组数据集上,模型在识别特定人口统计群体姓名方面表现更好。我们还发现,去偏嵌入无助于解决此问题。最后,我们观察到基于字符的上下文词表示模型(如 ELMo)在不同人口统计群体间产生的偏差最小。我们的工作可揭示由于系统性排除属于某些人口统计群体的命名实体而导致的自动知识库生成中的潜在偏差。

关键词

引用

@article{arxiv.2008.03415,
  title  = {Assessing Demographic Bias in Named Entity Recognition},
  author = {Shubhanshu Mishra and Sijun He and Luca Belli},
  journal= {arXiv preprint arXiv:2008.03415},
  year   = {2020}
}

备注

Presented at the AKBC Workshop on Bias in Automatic Knowledge Graph Construction, 2020 (arXiv:2007.11659)