中文

实体替换数据集:一种审计命名实体识别模型领域内鲁棒性的方法

计算与语言 2021-01-14 v2

摘要

命名实体识别系统在包含英文新闻的标准数据集上表现良好。但由于数据匮乏,难以就系统识别多样化实体集合的鲁棒性得出结论。我们提出了一种审计系统领域内鲁棒性的方法,特别关注因实体国籍来源不同而导致的性能差异。我们创建了实体替换数据集,其中原始文本中的命名实体被同类型但不同国籍来源的合理命名实体所替换。我们发现,即使在领域内,最先进系统的性能差异也很大:在相同语境下,某些来源的实体比其它地方的实体更能被可靠识别。系统在美国和印度实体上表现最好,在越南和印度尼西亚实体上表现最差。这种审计方法有助于开发更鲁棒的命名实体识别系统,并将使该领域的研究能够考虑在其他预测技术工作中受到高度关注的公平性标准。

关键词

引用

@article{arxiv.2004.04123,
  title  = {Entity-Switched Datasets: An Approach to Auditing the In-Domain Robustness of Named Entity Recognition Models},
  author = {Oshin Agarwal and Yinfei Yang and Byron C. Wallace and Ani Nenkova},
  journal= {arXiv preprint arXiv:2004.04123},
  year   = {2021}
}