中文

ParaNames 1.0:利用Wikidata为400多种语言创建实体名称语料库

计算与语言 2024-05-16 v1 人工智能

摘要

我们介绍ParaNames,一个大规模多语言平行名称资源,包含超过400种语言的1.4亿个名称。为1680万个实体提供名称,每个实体从复杂的类型层次映射到标准类型(PER/LOC/ORG)。使用Wikidata作为来源,我们创建了迄今为止最大的此类资源。我们描述了过滤和标准化数据的方法,以提供尽可能高的质量。ParaNames对于多语言语言处理非常有用,既可用于定义名称翻译/音译任务,也可作为命名实体识别和链接等任务的补充数据。我们在两个任务上展示了ParaNames的实用性。首先,我们在英语和其他17种语言之间进行规范名称翻译。其次,我们将其用作多语言命名实体识别的词典,在所有评估的10种语言上都获得了性能提升。

关键词

引用

@article{arxiv.2405.09496,
  title  = {ParaNames 1.0: Creating an Entity Name Corpus for 400+ Languages using Wikidata},
  author = {Jonne Sälevä and Constantine Lignos},
  journal= {arXiv preprint arXiv:2405.09496},
  year   = {2024}
}

备注

Accepted to LREC-COLING 2024. arXiv admin note: text overlap with arXiv:2202.14035