中文

索引、分块与过滤后的概率记录链接与去重

统计方法学 2016-03-28 v1

摘要

概率记录链接是指在缺乏唯一标识符的情况下合并两个或更多数据库的任务,这是一个长期存在的挑战性问题。它与单个数据库的去重问题密切相关,后者可视为将单个数据库与自身链接。在这两种情况下,可能链接的数量随所考虑数据库的规模迅速增长,并且在大多数应用中,有必要首先减少将要比较的记录对的数量。受实际考虑的推动,已针对该任务开发了一系列方法。这些方法有各种名称,包括索引和分块,并已得到显著发展。然而,用于推断链接结构且考虑索引、分块以及额外过滤步骤的方法并未得到相应的发展。在本文中,我们回顾了在流行的Fellegi-Sunter框架内索引、分块和过滤的影响,并提出了一种新模型来考虑特定形式的索引和过滤。

关键词

引用

@article{arxiv.1603.07816,
  title  = {Probabilistic Record Linkage and Deduplication after Indexing, Blocking, and Filtering},
  author = {Jared S. Murray},
  journal= {arXiv preprint arXiv:1603.07816},
  year   = {2016}
}