AutoBlock:一种用于实体匹配的全自动分块框架
数据库
2019-12-10 v1 机器学习
摘要
实体匹配旨在识别一个或多个数据源中指向同一真实世界实体的数据记录。几乎每个大规模数据集上的实体匹配任务都需要分块,这一步骤可减少待匹配记录对的数量。然而,大多数传统分块方法无学习过程且基于关键字,其成功很大程度上建立在清洗数据与设计分块键的繁重人力之上。在本文中,我们提出 AutoBlock,一种基于保相似度表示学习与最近邻搜索的、用于实体匹配的新型全自动(hands-off)分块框架。我们的贡献包括:(a) 自动化:AutoBlock 将用户从繁重的数据清洗与分块键调优中解放出来。(b) 可扩展性:AutoBlock 具有亚二次总时间复杂度,并可轻松部署于数百万记录。(c) 有效性:在多个大规模真实数据集上,尤其当数据集含噪和/或非结构化时,AutoBlock 优于广泛的竞争性基线。
引用
@article{arxiv.1912.03417,
title = {AutoBlock: A Hands-off Blocking Framework for Entity Matching},
author = {Wei Zhang and Hao Wei and Bunyamin Sisman and Xin Luna Dong and Christos Faloutsos and David Page},
journal= {arXiv preprint arXiv:1912.03417},
year = {2019}
}
备注
In The Thirteenth ACM International Conference on Web Search and Data Mining (WSDM '20), February 3-7, 2020, Houston, TX, USA. ACM, Anchorage, Alaska, USA , 9 pages