中文

从 HNSW 到信息论二值化:重新思考可扩展向量搜索的架构

数据库 2026-01-21 v1 信息检索 信息论 性能 math.IT

摘要

现代语义搜索和检索增强生成(RAG)系统主要依赖于高精度浮点向量的内存近似最近邻(ANN)索引,导致运营成本不断上升,并在延迟、吞吐量和检索精度之间存在固有的权衡。本文分析了占主导地位的“HNSW + float32 + 余弦相似度”技术栈的架构局限性,并评估了现有的成本降低策略,包括存储分解和有损向量量化,这些策略不可避免地牺牲性能或精度。我们引入并实证评估了一种基于最大信息二值化(MIB)、高效按位距离度量和信息论评分(ITS)机制的替代信息论架构。与传统 ANN 系统不同,这种方法允许对紧凑的二进制表示进行穷举搜索,从而实现确定性检索并消除高查询并发下的精度下降。使用 MAIR 基准在 14 个数据集和 10,038 个查询上,我们将该架构与 Elasticsearch、Pinecone、PGVector 和 Qdrant 进行了比较。结果表明,检索质量与全精度系统相当,同时实现了显著更低的延迟,并在高请求率下保持恒定的吞吐量。我们证明,这种架构转变实现了真正的无服务器、按查询付费的部署模型,挑战了高质量语义搜索对大型内存 ANN 索引的必要性。

关键词

引用

@article{arxiv.2601.11557,
  title  = {From HNSW to Information-Theoretic Binarization: Rethinking the Architecture of Scalable Vector Search},
  author = {Seyed Moein Abtahi and Majid Fekri and Tara Khani and Akramul Azim},
  journal= {arXiv preprint arXiv:2601.11557},
  year   = {2026}
}

备注

16 Pages, 5 Figures, 3 Tables