用于集体实体解析的查询驱动采样
数据库
2015-08-14 v1
摘要
概率数据库在处理和管理不确定数据中起着卓越的作用。近来,许多数据库研究致力于将概率模型集成到数据库中,以支持信息抽取和标注等任务。其中许多工作基于面向批处理的推断,这阻碍了实时工作流。一个重要任务是实体解析(ER)。ER是确定数据库中对应于同一真实世界实体的记录(提及)的过程。传统的成对ER方法由于局部决策可能导致不一致和低精度。领先的ER系统通过使用概率图模型和马尔可夫链蒙特卡洛(MCMC)推断集体解析所有记录来解决此问题。然而,对于大型数据集,这是一个极其昂贵的过程。一个关键观察是,这种穷举式ER过程会产生巨大的前期成本,这在实际中是浪费的,因为大多数用户只对所涉实体的小子集感兴趣。在本文中,我们倡导按需付费实体解析,开发了若干查询驱动的集体ER技术。我们引入了两类涉及ER算子的SQL查询——选择驱动ER和连接驱动ER。我们实现了MCMC Metropolis Hastings算法的新变体以生成偏置样本,以及基于选择性的调度算法来支持这两类ER查询。最后,我们展示了查询驱动ER算法能够在一个填充了来自包含7100万提及的新闻专线数据集抽取的数据库上,在数分钟内收敛并返回结果。
引用
@article{arxiv.1508.03116,
title = {Query-Driven Sampling for Collective Entity Resolution},
author = {Christan Grant and Daisy Zhe Wang and Michael L. Wick},
journal= {arXiv preprint arXiv:1508.03116},
year = {2015}
}