中文

全球英语命名实体识别数据集:低资源英语变体的泛化能力评估

计算与语言 2024-04-23 v1 机器学习

摘要

尽管存在许多全球英语变体,但命名实体识别(NER)数据集大多包含英国英语或美国英语。因此,目前尚不清楚这些数据集训练的模型能否泛化到全球英语的使用场景。为检验这一点,我们构建了一个新的新闻专线数据集——全球英语命名实体识别数据集(Worldwide English NER Dataset),用于分析NER模型在全球各地低资源英语变体上的性能。我们在三个数据集上测试了广泛使用的NER工具包和Transformer模型,包括使用预训练上下文模型RoBERTa和ELECTRA的模型:常用的英国英语新闻专线数据集CoNLL 2003、更侧重美国英语的OntoNotes数据集,以及我们的全球数据集。所有在CoNLL或OntoNotes数据集上训练的模型,在测试全球英语数据集时,性能均出现显著下降,某些情况下F1值下降超过10。通过检查特定地区的错误,我们发现大洋洲和非洲的性能下降最为显著,而亚洲和中东地区的表现相对较好。最后,我们发现,在全球数据集与CoNLL或OntoNotes任一数据集上联合训练的模型,在两个测试集上的F1值仅下降1-2。

关键词

引用

@article{arxiv.2404.13465,
  title  = {Do "English" Named Entity Recognizers Work Well on Global Englishes?},
  author = {Alexander Shan and John Bauer and Riley Carlson and Christopher Manning},
  journal= {arXiv preprint arXiv:2404.13465},
  year   = {2024}
}

备注

EMNLP Findings 2023