CrowdER:众包实体解析
数据库
2012-08-10 v1
摘要
实体解析是数据集成和数据清洗的核心。算法方法的质量一直在提高,但仍远非完美。众包平台提供了一种更准确但昂贵(且缓慢)的方式,将人类洞察力引入该过程。先前的工作提出了将验证任务分批呈现给人类工作者,但即使进行了分批,由于需要测试的匹配数量巨大,纯人工方法对于即使是中等规模的数据集也是不可行的。相反,我们提出了一种人机混合方法,其中机器用于对所有数据进行初步的粗略筛选,而人类仅用于验证最可能的匹配对。我们表明,对于此类混合系统,生成给定大小的最少验证任务是 NP 难的,但我们开发了一种新颖的双层启发式方法来创建分批任务。我们描述了该方法,并展示了在使用流行众包平台的真实数据集上进行的大量实验结果。实验表明,与纯机器或纯人工替代方案相比,我们的混合方法既实现了良好的效率,又保持了高准确率。
引用
@article{arxiv.1208.1927,
title = {CrowdER: Crowdsourcing Entity Resolution},
author = {Jiannan Wang and Tim Kraska and Michael J. Franklin and Jianhua Feng},
journal= {arXiv preprint arXiv:1208.1927},
year = {2012}
}
备注
VLDB2012