中文

DBpedia NIF:开放、大规模且多语种的知识抽取语料库

计算与语言 2018-12-27 v1 信息检索

摘要

在过去十年中,DBpedia 社区投入了大量精力开发技术基础设施和方法,以从 Wikipedia 中高效抽取结构化信息。这些努力主要集中在收集、精炼和发布 Wikipedia 文章中的半结构化信息,如信息框、分类信息、图像、wiki 链接和引文中的信息。然而,大量有价值的信息仍然包含在非结构化的 Wikipedia 文章文本中。在本文中,我们提出了 DBpedia NIF——一个大规模且多语种的知识抽取语料库。该数据集的目标是双重的:极大地拓宽和加深 DBpedia 中结构化信息的数量,并为各种 NLP 和 IR 任务的开发提供大规模且多语种的语言资源。该数据集提供了 128 种 Wikipedia 语言的所有文章内容。我们描述了数据集的创建过程以及用于对 Wikipedia 文章的内容、链接和信息结构进行建模的自然语言交互格式(NIF)。该数据集进一步丰富了约 25% 的链接,并选定的分区作为 Linked Data 发布。最后,我们描述了数据集的维护和可持续性计划,以及来自 TextExt 知识抽取挑战赛的选定用例。

关键词

引用

@article{arxiv.1812.10315,
  title  = {DBpedia NIF: Open, Large-Scale and Multilingual Knowledge Extraction Corpus},
  author = {Milan Dojchinovski and Julio Hernandez and Markus Ackermann and Amit Kirschenbaum and Sebastian Hellmann},
  journal= {arXiv preprint arXiv:1812.10315},
  year   = {2018}
}

备注

15 pages, 1 figure, 4 tables, 1 listing