中文

SIEVE:基于索引集合的高效过滤向量搜索

数据库 2025-07-22 v2 信息检索

摘要

许多现实世界任务(例如推荐带有儿童标签的视频)可以归约为查找与硬谓词相关联的最相似向量。这一任务即过滤向量搜索,极具挑战性,因为先前最先进的基于图的(无过滤)相似性搜索技术在考虑硬约束时会迅速退化。也就是说,有效的基于图的过滤相似性搜索依赖于充分的连通性,以便在仅仅几跳内到达最相似项。为了考虑谓词,近期的工作提出修改图遍历,使其仅访问可能满足谓词的项。然而,它们无法为广泛的谓词提供“仅需几跳”的特性:如果只有小部分项满足谓词,它们必须显著限制谓词或损失效率。我们提出了一种相反的方法:我们不约束遍历,而是构建多个索引,每个索引服务于不同的谓词形式。为了有效构建,我们设计了一个三维分析模型,捕捉索引大小、搜索时间和召回率之间的关系,借此我们采用一种负载感知方法,将尽可能多的有用索引打包到一个集合中。在查询时,再次使用该分析模型来辨别在给定召回率下提供最快搜索速度的索引。我们展示了在具有不同选择率和谓词形式的数据集上的卓越性能与支持:我们的方法实现了高达 8.06 倍的加速,而构建时间仅为其他索引的 1%,内存占用不到标准 HNSW 图的 2.15 倍,且仅需对过往负载的适度了解。

关键词

引用

@article{arxiv.2507.11907,
  title  = {SIEVE: Effective Filtered Vector Search with Collection of Indexes},
  author = {Zhaoheng Li and Silu Huang and Wei Ding and Yongjoo Park and Jianjun Chen},
  journal= {arXiv preprint arXiv:2507.11907},
  year   = {2025}
}