中文

具有自适应重叠约束的高效分类学相似性连接

信息检索 2018-10-30 v1 数据库

摘要

相似性连接旨在找出两个记录集合之间所有相似的配对。已有方法通常处理拼写错误和缩写等人为差异,却忽略了词与词之间的语义关系。然而,此类关系有助于获得高质量的连接结果。本文利用分类学知识(即一组 IS-A 层次关系)来定义一种相似性度量,从而从两个数据集中找出语义相似的记录。基于该度量,我们开发了一种采用前缀过滤框架的相似性连接算法,以有效剪枝掉不相关的配对。我们的技术贡献在于一种算法,它审慎地选择前缀过滤器中的关键参数以最大化其过滤能力,并辅以估计技术与蒙特卡洛模拟过程。实证实验表明,我们提出的方法具有高效性和可扩展性,大幅优于当前最优(state-of-the-art)方法。

关键词

引用

@article{arxiv.1810.12123,
  title  = {Efficient Taxonomic Similarity Joins with Adaptive Overlap Constraint},
  author = {Pengfei Xu and Jiaheng Lu},
  journal= {arXiv preprint arXiv:1810.12123},
  year   = {2018}
}