中文

如何缩减实体解析的搜索空间:基于分块还是最近邻搜索?

数据库 2022-10-07 v5

摘要

实体解析(Entity Resolution)具有二次时间复杂度。为提升其时间效率,通常使用三类过滤技术以限制其搜索空间:(i) 分块工作流(blocking workflows),将具有相同或相似签名的实体档案分组;(ii) 字符串相似度连接算法(string similarity join),快速检测相似度高于阈值的实体;(iii) 最近邻方法(nearest-neighbor methods),将每个实体档案转换为向量并依据指定距离函数快速检测最接近实体。每类均已提出大量方法,但文献缺乏对其相对性能的比较分析。如本文所示,这是一项非平凡任务,因为配置参数对每种过滤技术的性能有显著影响。我们开展了首项系统性实验研究,在 10 个真实数据集上考察各类主要方法的相对性能。对每种方法,我们考虑大量参数配置,并针对召回率与准确率进行优化。对每个数据集,我们考虑与模式无关(schema-agnostic)及基于模式(schema-based)两种设定。实验结果提供了关于所考察技术有效性与时间效率的新见解,证明了分块工作流与字符串相似度连接的优越性。

关键词

引用

@article{arxiv.2202.12521,
  title  = {How to reduce the search space of Entity Resolution: with Blocking or Nearest Neighbor search?},
  author = {George Papadakis and Marco Fisichella and Franziska Schoger and George Mandilaras and Nikolaus Augsten and Wolfgang Nejdl},
  journal= {arXiv preprint arXiv:2202.12521},
  year   = {2022}
}