中文

从以任务为中心的视角揭示隐藏陷阱并导航下一代向量相似度搜索

信息检索 2026-01-01 v2 数据库

摘要

高维空间中的向量相似度搜索正迅速成为下一代数据库系统中众多数据密集型服务的核心功能——从大型语言模型中的嵌入查找,到语义信息检索和推荐引擎。然而,当前的基准测试主要在由距离度量定义的真值上评估 VSS 的召回率-延迟权衡,忽略了检索质量最终如何影响下游任务。这种脱节可能会误导学术研究和工业实践。我们提出了 Iceberg,一个用于在现实应用上下文中端到端评估 VSS 方法的整体基准测试套件。从以任务为中心的视角出发,Iceberg 揭示了信息损失漏斗,该漏斗指出了端到端性能下降的三个主要来源:(1) 特征提取过程中的嵌入损失;(2) 度量误用,即距离无法良好反映任务相关性;(3) 数据分布敏感性,突出了索引在偏斜和多模态下的鲁棒性。为了进行更全面的评估,Iceberg 涵盖了图像分类、人脸识别、文本检索和推荐系统等关键领域的八个多样化数据集。每个数据集包含 100 万到 1 亿个向量,并附带丰富的任务特定标签和评估指标,从而能够在完整的应用流程中而非孤立地评估检索算法。Iceberg 对 13 种最先进的 VSS 方法进行了基准测试,并根据应用级指标对它们进行了重新排序,揭示了与纯粹基于召回率-延迟评估得出的传统排名的显著偏差。基于这些见解,我们定义了一组以任务为中心的元特征,并推导出一棵可解释的决策树,以指导从业者为其特定工作负载选择和调优 VSS 方法。

关键词

引用

@article{arxiv.2512.12980,
  title  = {Reveal Hidden Pitfalls and Navigate Next Generation of Vector Similarity Search from Task-Centric Views},
  author = {Tingyang Chen and Cong Fu and Jiahua Wu and Haotian Wu and Hua Fan and Xiangyu Ke and Yunjun Gao and Yabo Ni and Anxiang Zeng},
  journal= {arXiv preprint arXiv:2512.12980},
  year   = {2026}
}

备注

SIGMOD2026