中文

从 Web 表格中发现新实体

信息检索 2020-02-06 v1 计算与语言

摘要

在使用任何知识库 (KB) 时,都必须尽可能确保其完整且最新。这两项任务均非易事,因为它们需要以召回为导向的努力来确定 KB 中缺失哪些实体与关系,因而需要大量人工。另一方面,Web 上的表格资源丰富,且具有协助完成这些任务的独特潜力。具体而言,我们可以利用此类表格中的内容来发现新实体、属性与关系。由于 Web 表格通常仅含原始文本内容,我们首先需确定哪些单元格指代哪些已知实体——我们将此任务称为表到 KB 匹配。该首要任务旨在通过将这些表格单元格与标题列链接至 KB 元素来推断表格语义。随后第二项任务基于这些已链接的实体与属性,不仅识别同一表格中的新实体,还自举其类型与附加关系。我们将此过程称为新实体发现,据我们所知,这是首个从 Web 表格未链接单元格中挖掘信息的尝试。我们的方法不仅识别 KB 外(“新”)信息,也识别 KB 内(“已知”)实体的新别名。在使用三个专门构建的测试集进行评估时,我们发现所提方法在保持召回稳定的同时,相较基线在精度上取得显著提升。

关键词

引用

@article{arxiv.2002.00206,
  title  = {Novel Entity Discovery from Web Tables},
  author = {Shuo Zhang and Edgar Meij and Krisztian Balog and Ridho Reinanda},
  journal= {arXiv preprint arXiv:2002.00206},
  year   = {2020}
}

备注

Proceedings of The Web Conference 2020 (WWW '20), 2020