基于众包的容错实体解析
数据库
2015-12-03 v1
摘要
近年来,众包日益被用作提升数据质量的手段。尽管众包人员能产生富有洞察力的信息,尤其对于实体解析(ER)等复杂问题,但其输出质量常有噪声。即工作者即使对简单任务也可能无意中产生错误或矛盾的数据。本文应对的挑战是:在众包输入不可靠的假设下,如何最小化任务请求者的成本同时最大化ER结果质量。为此,我们首先确立作为数据解释问题一部分的如何从有噪声的工人答案推导出一致的ER解。接着我们关注下一众包问题,即找到以最小额外成本最大化ER结果信息增益的下一个任务。我们将鲁棒数据解释策略与未纳入容错(即对噪声的鲁棒性)概念的其他前沿方法比较。实验评估显示,对于两个真实数据集,我们的方法带来至少20%的质量提升。此外,本文从成本与质量权衡角度考察了任务-工人分配策略以及任务并行化技术。基于合成与众包数据集,我们得出如何在保持高质量ER结果的同时最小化成本的结论。
引用
@article{arxiv.1512.00537,
title = {Fault-Tolerant Entity Resolution with the Crowd},
author = {Anja Gruenheid and Besmira Nushi and Tim Kraska and Wolfgang Gatterbauer and Donald Kossmann},
journal= {arXiv preprint arXiv:1512.00537},
year = {2015}
}