面向VecDB的超高效RAG系统:分布式并行多分辨率向量搜索
计算与语言
2026-03-31 v2 人工智能
摘要
检索增强生成(RAG)系统已成为增强大语言模型(LLM)外部知识的主流方法。然而,现有向量数据库(VecDB)检索管道依赖平坦或单分辨率索引结构,无法适应不同用户查询所需的不同语义粒度。这一限制导致检索速度与上下文相关性之间达到次佳的权衡。为此,我们提出了“语义金字塔索引(SPI)”,一种 novel 多分辨率向量索引框架,引入查询自适应分辨率控制,用于VecDB中的RAG。不同于需要离线调优或独立模型训练的层次方法,SPI在文档嵌入上构建语义金字塔,并通过轻量级分类器动态选择每个查询的最优分辨率层级。这种自适应方法 enables 从粗到细的渐进检索,显著加快搜索速度,同时保持语义覆盖。我们将SPI实现为FAISS和Qdrant后端的插件,并在多个RAG任务上进行评估,包括MS MARCO、Natural Questions和多模态检索基准。SPI实现了最高可达5.7倍的检索加速,1.8倍的内存效率提升,同时将端到端QA F1分数提高最高2.5分。我们的理论分析提供了检索质量保证和延迟边界,广泛的消融研究验证了每个组件的贡献。该框架与现有VecDB基础设施的兼容性使其可立即部署到生产RAG系统中。代码可在https://github.com/FastLM/SPI_VecDB获得。
引用
@article{arxiv.2511.16681,
title = {Towards Hyper-Efficient RAG Systems in VecDBs: Distributed Parallel Multi-Resolution Vector Search},
author = {Dong Liu and Yanxuan Yu},
journal= {arXiv preprint arXiv:2511.16681},
year = {2026}
}