MultiCoNER v2:用于细粒度且含噪声命名实体识别的大型多语言数据集
计算与语言
2023-10-23 v1 人工智能
摘要
我们提出MULTICONER V2,一个用于细粒度命名实体识别的数据集,涵盖12种语言、33个实体类,包含单语和多语设置。该数据集旨在应对NER中的以下实际挑战:(i)有效处理包含电影标题等复杂实体的细粒度类别;(ii)由输入错误或OCR错误产生的噪声导致的性能下降。该数据集编译自Wikipedia和Wikidata等开放资源,并公开可用。基于XLM-RoBERTa基线的评估凸显了MULTICONER V2带来的独特挑战:(i)细粒度分类体系具有难度,其得分较低,宏F1=0.63(跨所有语言);(ii)损坏策略显著损害性能,实体损坏相对于非实体损坏在所有语言下导致低9%的性能。这凸显了实体噪声相对于上下文噪声的更大影响。
引用
@article{arxiv.2310.13213,
title = {MultiCoNER v2: a Large Multilingual dataset for Fine-grained and Noisy Named Entity Recognition},
author = {Besnik Fetahu and Zhiyu Chen and Sudipta Kar and Oleg Rokhlenko and Shervin Malmasi},
journal= {arXiv preprint arXiv:2310.13213},
year = {2023}
}
备注
Accepted to the Findings of EMNLP 2023