Freebase-triples:一种处理 Freebase 数据转储的方法论
数据库
2017-12-27 v1
摘要
Freebase 知识库自 2007 年运营以来是一项重要的语义网与关联数据技术。在 2010 年被 Google 收购并于 2016 年关停后,Freebase 数据包含在数十亿 RDF 三元组的数据转储中。在本研究中,对 Freebase 数据转储的探查将展示理解和使用 Freebase 数据的最佳实践,并提出一种解析关联数据的一般方法论。分析在有限的计算资源和使用开源类 Unix 工具的条件下完成。结果展示了该技术的效率,并凸显了数据中的冗余,有可能重构近 60% 的原始数据。作为一个自 2015 年以来未改变的档案数据集,Freebase 的语义结构化数据在其他重要领域有应用,例如信息检索(IR)和基于知识库的问答(KBQA)。Freebase 也可作为通往其他结构化数据集(如 DBpedia、Wikidata 和 YAGO)的门户。
引用
@article{arxiv.1712.08707,
title = {Freebase-triples: A Methodology for Processing the Freebase Data Dumps},
author = {Niel Chah},
journal= {arXiv preprint arXiv:1712.08707},
year = {2017}
}