中文

向量相似性搜索中的距离比较运算并非银弹:基于DCO方法的基准研究

数据库 2026-04-06 v1

摘要

距离比较运算(DCO)用于决定数据向量与查询之间距离是否在阈值范围内,是向量相似性搜索中的关键性能瓶颈。最近一批规避完整维度距离计算的DCO方法承诺可实现显著加速,但其在生产级向量数据库系统中的就绪状态尚存未知问题。为此,我们对8种DCO算法进行了全面基准测试,涵盖10个数据集(最高达1亿向量,12,288维)和多种硬件配置(带SIMD的CPU、无SIMD的CPU以及GPU)。我们的研究表明,这些方法并非银弹:其效率对数据维度高度敏感,在分布外查询下性能下降,且在不同硬件间不稳定。然而,我们的评估也常被忽视地揭示了显著优势:它们可加速索引构建和数据更新。尽管有这些好处,但其不稳定的性能(甚至可能慢于完整维度扫描),导致我们得出结论:近期DCO算法的算法性突破尚未准备好投入生产部署。

关键词

引用

@article{arxiv.2604.02801,
  title  = {Distance Comparison Operations Are Not Silver Bullets in Vector Similarity Search: A Benchmark Study on Their Merits and Limits},
  author = {Zhuanglin Zheng and Yuxiang Zeng and Chenchen Liu and Yunzhen Chi and Binhan Yang and Yongxin Tong},
  journal= {arXiv preprint arXiv:2604.02801},
  year   = {2026}
}

备注

To appear in 42nd IEEE International Conference on Data Engineering (ICDE) 2026