Wikidata 质量研究
人工智能
2021-11-22 v4
摘要
Wikidata 已被许多社区日益广泛地采用,用于各种各样的应用,这些应用需要高质量的知识以取得成功的结果。在本文中,我们开发了一个框架,通过揭示社区当前实践来检测和分析 Wikidata 中的低质量陈述。我们基于以下方面探索了 Wikidata 中数据质量的三个指标:1)社区对当前记录知识的共识,假设已被移除且未重新添加的的陈述被隐式认为质量低;2)已被弃用的陈述;以及 3)数据中的约束违反。我们结合这些指标来检测低质量陈述,揭示了重复实体、缺失三元组、违反类型规则和分类区分方面的挑战。我们的发现补充了 Wikidata 社区正在进行的改进数据质量的工作,旨在使用户和编辑更容易发现和纠正错误。
引用
@article{arxiv.2107.00156,
title = {A Study of the Quality of Wikidata},
author = {Kartik Shenoy and Filip Ilievski and Daniel Garijo and Daniel Schwabe and Pedro Szekely},
journal= {arXiv preprint arXiv:2107.00156},
year = {2021}
}
备注
12 pages