中文

从数据融合到知识融合

数据库 2015-03-03 v1

摘要

数据融合的任务是识别数据项的真值(例如,Tom Cruise 的真实出生日期),这些数据项来自不同可靠性(且未知)的多个来源(例如,网站)观察到的多个值。最近的一项调查\cite{LDL+12} 详细比较了各种融合方法在深网数据上的表现。在本文中,我们研究了不同融合技术在一个更具挑战性问题上的适用性和局限性:知识融合。知识融合识别由多个信息抽取器从多个信息源抽取的真实主语-谓语-宾语三元组。这些抽取器执行实体链接和模式对齐任务,从而引入了额外的噪声源,这与数据融合文献中传统考虑的仅关注原始来源中的事实错误截然不同。我们调整了最先进的数据融合技术,并将其应用于一个知识库,该知识库包含由 12 个抽取器从超过 10 亿个网页中抽取的 16 亿(1.6B)个唯一知识三元组,这比先前数据融合论文中使用的数据集大三个数量级。我们通过方法的详细错误分析展示了数据融合方法在解决知识融合问题上的巨大前景,并提出了有趣的研究方向。

关键词

引用

@article{arxiv.1503.00302,
  title  = {From Data Fusion to Knowledge Fusion},
  author = {Xin Luna Dong and Evgeniy Gabrilovich and Geremy Heitz and Wilko Horn and Kevin Murphy and Shaohua Sun and Wei Zhang},
  journal= {arXiv preprint arXiv:1503.00302},
  year   = {2015}
}

备注

VLDB'2014