中文

ParaNames:一个大规模多语言实体名称语料库

计算与语言 2022-07-13 v3 人工智能

摘要

我们介绍了 ParaNames,一个包含跨越 400 种语言的 1.18 亿个名称的多语言并行名称资源。这些名称对应 1360 万个实体,并被映射到标准化实体类型(PER/LOC/ORG)。以 Wikidata 为来源,我们创建了迄今为止规模最大的此类资源。我们描述了用于过滤和标准化数据以提供最佳质量的方法。ParaNames 对多语言语言处理很有用,既可用于定义名称翻译/音译任务,也可作为命名实体识别与链接等任务的补充数据。我们通过训练一个用于与英语互译的规范名称翻译的多语言模型,展示了 ParaNames 的一个应用。我们的资源基于知识共享许可(CC BY 4.0)发布于 https://github.com/bltlab/paranames。

关键词

引用

@article{arxiv.2202.14035,
  title  = {ParaNames: A Massively Multilingual Entity Name Corpus},
  author = {Jonne Sälevä and Constantine Lignos},
  journal= {arXiv preprint arXiv:2202.14035},
  year   = {2022}
}

备注

Resource available at https://github.com/bltlab/paranames