中文

MultiCoNER:用于复杂命名实体识别的大规模多语言数据集

计算与语言 2022-09-01 v1

摘要

我们提出MultiCoNER,一个用于命名实体识别的大规模多语言数据集,覆盖11种语言的3个领域(维基句子、问题和搜索查询),以及多语言与语码混合子集。该数据集旨在体现NER中的当代挑战,包括低上下文场景(短且未大小写文本)、如电影标题般句法复杂的实体,以及长尾实体分布。该2600万词元的数据集使用启发式句子采样、模板抽取与填充以及机器翻译等技术从公共资源编译而来。我们在数据集上应用了两个NER模型:基线XLM-RoBERTa模型,以及利用地名录的最先进GEMNET模型。基线取得中等性能(宏F1=54%),凸显了数据的难度。使用地名录的GEMNET显著提升(宏F1平均提升=+30%)。即便对大型预训练语言模型,MultiCoNER也构成挑战,我们相信它可助力构建鲁棒NER系统的进一步研究。MultiCoNER公开于https://registry.opendata.aws/multiconer/,希望该资源能推动NER各方面研究。

关键词

引用

@article{arxiv.2208.14536,
  title  = {MultiCoNER: A Large-scale Multilingual dataset for Complex Named Entity Recognition},
  author = {Shervin Malmasi and Anjie Fang and Besnik Fetahu and Sudipta Kar and Oleg Rokhlenko},
  journal= {arXiv preprint arXiv:2208.14536},
  year   = {2022}
}

备注

Accepted at COLING 2022