中文

针对良好分散数据点的 LSH 精细分析

数据结构与算法 2016-12-15 v1 计算几何

摘要

近邻问题是高维 Euclid 空间算法中的基本问题。经典方法遭受维数灾难,而局部敏感哈希 (LSH) 能有效解决 a-近似 r-近邻问题,并已被证明在最坏情况下是最优的。然而,对于真实世界的数据集,LSH 可以自然地受益于数据的良好分散性和低倍增维数,从而显著提升性能。本文针对这一问题,对通过 LSH 近似近邻查询的运行时间提出了精细分析。我们使用 NbN_b(数据点中 brb*r-近邻对的数量)来刻画数据的分散性。结合最优的数据无关 LSH 方案,我们得到了一个依赖于 NbN_b 和倍增维数的新查询时间界。对于许多点良好分散或位于低倍增维数空间的自然场景,我们的结果给出了比现有最坏情况分析更精确的性能。本文不仅首次严格证明了 LSH 如何利用数据点的结构,也为 LSH 在最坏情况之外的实践中的参数设置提供了重要见解。此外,我们分析中的技术涉及球堆积问题的一个广义版本,这可能具有独立的研究兴趣。

关键词

引用

@article{arxiv.1612.04571,
  title  = {A Refined Analysis of LSH for Well-dispersed Data Points},
  author = {Wenlong Mou and Liwei Wang},
  journal= {arXiv preprint arXiv:1612.04571},
  year   = {2016}
}

备注

Paper accepted to SIAM Conference on Analytic Algorithmics and Combinatorics (ANALCO) 2017