利用 Wikipedia 与 DBpedia 构建面向复杂命名实体识别与分类层级的多语言语料库
计算与语言
2022-12-16 v1
摘要
随着 NLP 领域的日益流行,对低资源语言数据集的需求也随之增长。遵循先前建立的框架,本文提出 UNER 数据集,一个用于命名实体标注的多语言分层平行语料库。我们详细描述了在任何有 DBpedia 信息的 Wikipedia 可用语言上创建此类数据集所需的开发流程。该三步流程从 Wikipedia 文章中抽取实体,将其链接到 DBpedia,并将 DBpedia 的类集合映射到 UNER 标签。随后进行后处理流程,显著增加了最终结果中已识别实体的数量。本文以对所得数据集的统计与定性分析作结。
引用
@article{arxiv.2212.07429,
title = {Building Multilingual Corpora for a Complex Named Entity Recognition and Classification Hierarchy using Wikipedia and DBpedia},
author = {Diego Alves and Gaurish Thakkar and Gabriel Amaral and Tin Kuculo and Marko Tadić},
journal= {arXiv preprint arXiv:2212.07429},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2212.07162