面向 Web 实体的分块算法基准评测
数据库
2020-05-20 v1
摘要
Web 上越来越多的实体由互联数据而非文档来描述。实体解析(ER)旨在数据万维网中的一个或跨知识库中识别同一真实世界实体的描述。为减少描述间所需的成对比较次数,ER 方法通常执行一个称为分块(blocking)的预处理步骤,该步骤将相似的实体描述放入块中,从而仅比较同一块内的描述。我们使用真实数据集对为数据万维网提出的若干分块方法进行了实验评估,这些数据集的特征显著影响其效果与效率。所提出的实验评估框架使我们能更好地理解被遗漏的匹配实体描述的特征,并将其与从不同相关性链接获得的真值进行对比。
引用
@article{arxiv.2005.09399,
title = {Benchmarking Blocking Algorithms for Web Entities},
author = {Vasilis Efthymiou and Kostas Stefanidis and Vassilis Christophides},
journal= {arXiv preprint arXiv:2005.09399},
year = {2020}
}
备注
accepted at IEEE Transactions on Big Data journal