中文

众包实体解析的首批启发式算法理论分析

数据库 2017-02-07 v1 人工智能 机器学习

摘要

实体解析(ER)是识别数据库中指向同一底层实体因而彼此重复的所有记录的任务。由于数据表示固有的模糊性和糟糕的数据质量,ER对于任何自动化过程都是一项具有挑战性的任务。作为补救,近年来通过众包的人力驱动ER变得流行。使用众包来回答查询成本高且耗时。此外,众包答案常常可能有误。因此,基于众包的ER方法旨在不牺牲质量的前提下最小化人类参与,并主动使用计算机生成的相似度矩阵。尽管其中一些方法在实践中表现良好,但不存在针对它们的理论分析,并且它们的最坏情况性能并不能反映实验结果。这造成了对此问题的流行启发式算法理解上的差距。在本文中,我们首次尝试弥补这一差距。我们对基于众包的ER的著名启发式算法提供了透彻的分析。我们用我们的分析和信息论下界证明了实验观测的合理性。

关键词

引用

@article{arxiv.1702.01208,
  title  = {A Theoretical Analysis of First Heuristics of Crowdsourced Entity Resolution},
  author = {Arya Mazumdar and Barna Saha},
  journal= {arXiv preprint arXiv:1702.01208},
  year   = {2017}
}

备注

Appears in AAAI-17