中文

图基向量搜索:最新技术实验评估

信息检索 2025-09-08 v2 性能

摘要

向量数据在商业和科学应用中广泛存在,其流行度随着学习嵌入的普及而不断增长。向量数据集合常常达到数十亿个向量,维度可达数千,从而增加了其分析的复杂度。向量搜索是许多关键分析任务的基石,图基方法已成为无需保证答案质量的分析任务的最佳选择。我们简要概述了内存中图基向量搜索,梳理了不同方法的时间线,并根据五个主要设计范式对其进行分类:种子选择、增量插入、邻域传播、邻域多样化和分治。我们对十二种最新方法在七个真实数据集合上的实验进行详尽评估,数据规模可达10亿个向量。我们分享关于这些方法优势和局限性的关键见解;例如,最佳方法通常基于增量插入和邻域多样化,基本图的选择可能影响可扩展性。最后,我们讨论了开放的研究方向,如更为精细的数据自适应种子选择和多样化策略的重要性。

关键词

引用

@article{arxiv.2502.05575,
  title  = {Graph-Based Vector Search: An Experimental Evaluation of the State-of-the-Art},
  author = {Ilias Azizi and Karima Echihabi and Themis Palpanas},
  journal= {arXiv preprint arXiv:2502.05575},
  year   = {2025}
}