一种加速不确定数据库中相似性查询的新型概率剪枝方法
数据库
2015-03-17 v2
摘要
在本文中,我们针对不确定数据上的概率相似性查询,提出了一种新颖、有效且高效的概率剪枝准则。我们的方法支持使用连续概率密度函数来描述对象(可能相关的)不确定属性的通用不确定性模型。简而言之,要解决的问题是计算由概率支配计数表示的随机变量的概率密度函数:给定一个不确定数据库对象 B、一个不确定参考对象 R 以及多维空间中的一组不确定数据库对象 D,概率支配计数表示 D 中比 B 更接近 R 的不确定对象的数量。该支配计数可用于回答广泛的概率相似性查询。具体来说,我们提出了一种新颖的几何剪枝过滤器,并引入了一种迭代过滤-精炼策略,以保守且渐进的方式高效估计概率支配计数,同时根据可能世界语义保持正确性。在实验评估中,我们表明,即使对于大型不确定数据库,我们提出的技术也能快速获得概率支配计数的紧概率界。
引用
@article{arxiv.1101.2613,
title = {A Novel Probabilistic Pruning Approach to Speed Up Similarity Queries in Uncertain Databases},
author = {Thomas Bernecker and Tobias Emrich and Hans-Peter Kriegel and Nikos Mamoulis and Matthias Renz and Andreas Zuefle},
journal= {arXiv preprint arXiv:1101.2613},
year = {2015}
}