中文

反例揭示2006年提出的覆盖树时间复杂度证明中的漏洞

计算几何 2022-08-22 v1 数据结构与算法

摘要

本文的动机源于 k 近邻搜索:给定任意度量空间及其有限子集(参考集 R 与查询集 Q),设计快速算法为 Q 中每一点找出 R 中的所有 k 近邻。2006年,Beygelzimer、Kakade 与 Langford 引入覆盖树,以论证近邻搜索关于 Q、R 规模具有近线性时间复杂度。Curtin 的博士论文(2015)第5.3节指出该结果的证明是错误的。原证明的关键步骤试图通过将覆盖树中最长根到叶路径的长度乘以常数因子来估计迭代次数。然而,该估计可能遗漏覆盖树若干分支中应在近邻搜索时考虑的许多潜在节点。不幸的是,同样的论证在2006年以来若干使用覆盖树的后续论文中被重复。本文显式构造了具有挑战性的数据集,为过往关于覆盖树构建、ICML 2006 所展示的 k 近邻搜索、以及 NIPS 2009 发表的双树搜索算法的时间复杂度证明提供反例。修正后的带额外参数的近线性时间复杂度已在另一篇即将发表的论文中通过一种新的简化原树结构的压缩覆盖树得到证明。

关键词

引用

@article{arxiv.2208.09447,
  title  = {Counterexamples expose gaps in the proof of time complexity for cover trees introduced in 2006},
  author = {Yury Elkin and Vitaliy Kurlin},
  journal= {arXiv preprint arXiv:2208.09447},
  year   = {2022}
}

备注

Accepted in peer-reviewed Proceedings of TopoInVis 2022 (IEEE Workshop on Topological Data Analysis and Visualization, https://topoinvis-workshop.github.io/2022). arXiv admin note: substantial text overlap with arXiv:2205.10194; text overlap with arXiv:2111.15478