中文

探索高维空间中最近邻搜索的意义

机器学习 2024-10-10 v1 数据库 信息检索

摘要

稠密的高维向量在计算机视觉、机器学习和大语言模型等领域正变得日益重要,作为多模态数据的标准表示。现在这些向量的维数可以轻松超过数千。尽管基于这些稠密高维向量的最近邻搜索已被广泛用于检索增强生成和许多其他应用,但由于“维度灾难”可能带来的挑战,最近邻搜索在此类高维空间中的有效性仍不确定。为回答上述问题,本文使用不同的距离函数(如 L1L_1 距离、L2L_2 距离和角距离),在多种类型、维度和模态的嵌入数据集上进行了广泛的最近邻搜索研究。我们的目标是探究影响最近邻搜索意义的因素。实验表明,与随机向量相比,高维文本嵌入在维数升高时表现出更强的韧性。这种韧性表明文本嵌入受“维度灾难”的影响较小,从而在实际应用中产生更有意义的最近邻搜索结果。此外,距离函数的选择对最近邻搜索的相关性影响甚微。我们的研究展示了基于嵌入的数据表示方法的有效性,并为稠密向量相关应用的进一步优化提供了机会。

关键词

引用

@article{arxiv.2410.05752,
  title  = {Exploring the Meaningfulness of Nearest Neighbor Search in High-Dimensional Space},
  author = {Zhonghan Chen and Ruiyuan Zhang and Xi Zhao and Xiaojun Cheng and Xiaofang Zhou},
  journal= {arXiv preprint arXiv:2410.05752},
  year   = {2024}
}