中文

重新审视高维数据上的$k$近邻图构建:实验与分析

数据结构与算法 2021-12-07 v1

摘要

高维数据上的kk近邻图(KNNG)是一种广泛应用于相似度搜索、降维和聚类等诸多任务的数据结构。由于其日益流行,过去十年中在同一框架下已提出若干方法。该框架包含两步,即构建初始KNNG(记为\texttt{INIT})然后通过邻域传播细化(记为\texttt{NBPG})。然而,仍有若干问题有待解答。首先,文献中代表性方案之间缺乏全面的实验比较。其次,一些近期提出的索引结构(如SW和HNSW)尚未被用于或测试用于构建初始KNNG。第三,数据属性与\texttt{NBPG}有效性之间的关系仍不明确。为解决这些问题,我们在真实高维数据集上全面比较代表性方法,为用户提供实用且具洞察的建议。作为首次尝试,我们在实验中将SW和HNSW作为\texttt{INIT}的替代方案。此外,我们研究了\texttt{NBPG}的有效性,并发现huness现象与\texttt{NBPG}性能之间的强相关性。

关键词

引用

@article{arxiv.2112.02234,
  title  = {Revisiting $k$-Nearest Neighbor Graph Construction on High-Dimensional Data : Experiments and Analyses},
  author = {Liu Yingfan and Cheng Hong and Cui Jiangtao},
  journal= {arXiv preprint arXiv:2112.02234},
  year   = {2021}
}