Fonduer:从富格式数据构建知识库
数据库
2018-03-05 v2
摘要
我们专注于从富格式数据中构建知识库(KBC)。与从文本或表格数据进行 KBC 不同,从富格式数据进行 KBC 旨在提取通过文本、结构、表格和视觉表达共同传达的关系。我们介绍了 Fonduer,一个基于机器学习的富格式数据 KBC 系统。Fonduer 提出了一种新的数据模型,该模型考虑了富格式数据的三个具有挑战性的特征:(1) 普遍的文档级关系,(2) 多模态,以及 (3) 数据多样性。Fonduer 使用一种新的深度学习模型来自动捕获学习如何从富格式数据中提取关系所需的表示(即特征)。最后,Fonduer 提供了一种新的编程模型,使用户能够将基于多种信息模态的领域专业知识转化为有意义的监督信号,用于训练 KBC 系统。基于 Fonduer 的 KBC 系统已在多种用例中投入生产,包括在一家大型在线零售商处。我们在四个不同领域将 Fonduer 与 SOTA 的 KBC 方法进行了比较。我们表明,与专家策划的公共知识库相比,Fonduer 在输出知识库质量上平均提高了 41 个 F1 分数——在某些情况下产生的正确条目数高达 1.87 倍。我们还进行了一项用户研究,以评估 Fonduer 新编程模型的可用性。我们表明,在使用 Fonduer 仅 30 分钟后,非领域专家能够设计出 KBC 系统,其质量平均比传统的基于机器学习的 KBC 方法高 23 个 F1 分数。
引用
@article{arxiv.1703.05028,
title = {Fonduer: Knowledge Base Construction from Richly Formatted Data},
author = {Sen Wu and Luke Hsiao and Xiao Cheng and Braden Hancock and Theodoros Rekatsinas and Philip Levis and Christopher Ré},
journal= {arXiv preprint arXiv:1703.05028},
year = {2018}
}