中文

基于枢轴的索引中的维度灾难

数据结构与算法 2016-11-17 v2

摘要

我们为基于枢轴的相似性搜索数据集索引中的维度灾难提供了理论验证,通过在统计学习框架中证明,在高维空间中,没有基于枢轴的索引方案能本质上优于线性扫描。我们对基于枢轴的索引方案的渐近性能进行了研究,研究对象是一系列数据集,这些数据集被建模为从度量空间Ωd\Omega_d中独立同分布抽取的样本XdX_d。我们允许数据集的大小n=ndn=n_d使得“维度”dd相对于nn是超对数但次多项式的。枢轴的数量允许增长为o(n/d)o(n/d)。我们选择了相似性搜索中最不严格的计算成本模型,其中每次距离计算计为一次计算,并忽略其余部分。我们证明,如果度量空间Ωd\Omega_d在测度集中现象意义上的内蕴维度是O(d)O(d),那么基于枢轴的相似性搜索索引的性能在渐近意义上是nn的线性函数。

关键词

引用

@article{arxiv.0906.0391,
  title  = {Curse of Dimensionality in Pivot-based Indexes},
  author = {Ilya Volnyansky and Vladimir Pestov},
  journal= {arXiv preprint arXiv:0906.0391},
  year   = {2016}
}

备注

9 pp., 4 figures, latex 2e, a revised submission to the 2nd International Workshop on Similarity Search and Applications, 2009