分布式存储大规模向量的近似最近邻搜索
数据库
2025-10-21 v1
摘要
高维空间的近似最近邻搜索(ANNS)是许多在线服务(如信息检索和推荐)的关键算子。由最先进 ANNS 算法构建的索引必须存储在单台机器的内存或磁盘中,以实现高召回率和吞吐量,导致巨大的存储成本、受限规模以及单点故障。虽然分布式存储可以提供经济高效且稳健的解决方案,但目前没有高效有效的算法可用于分布式存储场景下的向量索引。本文提出了一种新的图-聚类混合索引和搜索系统,支持分布式存储近似最近邻搜索,称为 DSANN。DSANN 可以高效地对大规模向量数据库进行索引、存储和搜索,并保证索引服务的高可用性。DSANN 采用并发索引构建方法显著降低了索引构建的复杂度。随后,DSANN 应用点聚合图(Point Aggregation Graph)利用图的结构信息聚合相似向量,优化存储效率并通过分布式存储中的异步 I/O提高查询吞吐量。通过大量实验,我们展示了 DSANN 在分布式存储场景下能够高效有效地对大规模向量数据集进行索引、存储和搜索。
引用
@article{arxiv.2510.17326,
title = {Approximate Nearest Neighbor Search of Large Scale Vectors on Distributed Storage},
author = {Kun Yu and Jiabao Jin and Xiaoyao Zhong and Peng Cheng and Lei Chen and Zhitao Shen and Jingkuan Song and Hengtao Shen and Xuemin Lin},
journal= {arXiv preprint arXiv:2510.17326},
year = {2025}
}