中文

近似最近邻搜索中向量ID的无损压缩

机器学习 2025-01-22 v1 数据库 信息检索

摘要

近似最近邻搜索依赖于通常从内存访问的索引。因此,存储是限制单台机器可服务数据库规模的因素。有损向量压缩,即嵌入量化,已被广泛用于减小索引大小。然而,对于倒排索引和基于图的索引,辅助数据如向量ID和链接(边)可能占据大部分存储成本。我们针对这些情况引入并评估了无损压缩方案。这些方法基于非对称数字系统或小波树,利用了数据结构中ID的顺序无关性。在某些设置下,我们能够将向量ID压缩7倍,且不影响准确率或搜索时间。在十亿级数据集上,这导致索引大小减少30%。此外,我们表明,对于某些数据集,这些方法还可以通过利用原始量化算法中的次优性来无损压缩量化向量码。我们方法的源代码可在 https://github.com/facebookresearch/vector_db_id_compression 获取。

关键词

引用

@article{arxiv.2501.10479,
  title  = {Lossless Compression of Vector IDs for Approximate Nearest Neighbor Search},
  author = {Daniel Severo and Giuseppe Ottaviano and Matthew Muckley and Karen Ullrich and Matthijs Douze},
  journal= {arXiv preprint arXiv:2501.10479},
  year   = {2025}
}