中文

Freebase-triples:一种处理 Freebase 数据转储的方法论

数据库 2017-12-27 v1

摘要

Freebase 知识库自 2007 年运营以来是一项重要的语义网与关联数据技术。在 2010 年被 Google 收购并于 2016 年关停后,Freebase 数据包含在数十亿 RDF 三元组的数据转储中。在本研究中,对 Freebase 数据转储的探查将展示理解和使用 Freebase 数据的最佳实践,并提出一种解析关联数据的一般方法论。分析在有限的计算资源和使用开源类 Unix 工具的条件下完成。结果展示了该技术的效率,并凸显了数据中的冗余,有可能重构近 60% 的原始数据。作为一个自 2015 年以来未改变的档案数据集,Freebase 的语义结构化数据在其他重要领域有应用,例如信息检索(IR)和基于知识库的问答(KBQA)。Freebase 也可作为通往其他结构化数据集(如 DBpedia、Wikidata 和 YAGO)的门户。

关键词

引用

@article{arxiv.1712.08707,
  title  = {Freebase-triples: A Methodology for Processing the Freebase Data Dumps},
  author = {Niel Chah},
  journal= {arXiv preprint arXiv:1712.08707},
  year   = {2017}
}