近似近邻搜索中基于哈希的最优时空权衡
摘要
[完整摘要请参见论文。] 我们展示了 c-近似近邻搜索问题时空权衡的紧确上下界。对于 d 维欧几里得空间和 n 点数据集,我们开发了一种数据结构,其空间复杂度为 n^{1 + ρ_u + o(1)} + O(dn),查询时间为 n^{ρ_q + o(1)} + d n^{o(1)},适用于所有满足以下条件的 ρ_u, ρ_q ≥ 0:c^2 √ρ_q + (c^2 - 1) √ρ_u = √(2c^2 - 1)。这是首个对于每个近似因子 c > 1 都能实现亚线性查询时间和近线性空间的数据结构,改进了 [Kapralov, PODS 2015] 的结果。该数据结构是长期以来针对所有空间区间研究该问题的集大成之作;它建立在球面局部敏感过滤 [Becker, Ducas, Gama, Laarhoven, SODA 2016] 和数据依赖哈希 [Andoni, Indyk, Nguyen, Razenshteyn, SODA 2014] [Andoni, Razenshteyn, STOC 2015] 的基础上。我们匹配的下界分为两类:条件性和无条件性。首先,我们在一个受限计算模型中证明了上述整个权衡的紧致性,该模型涵盖了所有已知的基于哈希的方法。然后,我们展示了一次和两次探测的无条件细胞探针下界,这些下界在 ρ_q = 0 时与上述权衡相匹配,改进了 [Panigrahy, Talwar, Wieder, FOCS 2010] 中已知的最佳下界。特别地,这是首个针对两次探测的空间下界(对于任何静态数据结构),该下界并非多项式级别地小于一次探测的下界。为了证明两次探测的结果,我们建立并利用了与局部可解码码的联系。
引用
@article{arxiv.1608.03580,
title = {Optimal Hashing-based Time-Space Trade-offs for Approximate Near Neighbors},
author = {Alexandr Andoni and Thijs Laarhoven and Ilya Razenshteyn and Erik Waingarten},
journal= {arXiv preprint arXiv:1608.03580},
year = {2019}
}
备注
62 pages, 5 figures; a merger of arXiv:1511.07527 [cs.DS] and arXiv:1605.02701 [cs.DS], which subsumes both of the preprints. New version contains more elaborated proofs and fixed some typos