中文

利用 Wikipedia 与 DBpedia 构建面向复杂命名实体识别与分类层级的多语言语料库

计算与语言 2022-12-16 v1

摘要

随着 NLP 领域的日益流行,对低资源语言数据集的需求也随之增长。遵循先前建立的框架,本文提出 UNER 数据集,一个用于命名实体标注的多语言分层平行语料库。我们详细描述了在任何有 DBpedia 信息的 Wikipedia 可用语言上创建此类数据集所需的开发流程。该三步流程从 Wikipedia 文章中抽取实体,将其链接到 DBpedia,并将 DBpedia 的类集合映射到 UNER 标签。随后进行后处理流程,显著增加了最终结果中已识别实体的数量。本文以对所得数据集的统计与定性分析作结。

关键词

引用

@article{arxiv.2212.07429,
  title  = {Building Multilingual Corpora for a Complex Named Entity Recognition and Classification Hierarchy using Wikipedia and DBpedia},
  author = {Diego Alves and Gaurish Thakkar and Gabriel Amaral and Tin Kuculo and Marko Tadić},
  journal= {arXiv preprint arXiv:2212.07429},
  year   = {2022}
}

备注

arXiv admin note: substantial text overlap with arXiv:2212.07162