针对多过滤器的最近邻搜索学习滤波感知距离度量
机器学习
2025-11-07 v1 数据库
信息检索
摘要
过滤近邻(ANN)搜索从数据集中检索查询向量的最近向量。它强制指定的一组离散标签必须包含在每个检索向量的标签中。现有图基方法通常通过分配固定惩罚或基于过滤满足情况优先级节点来实现过滤感知。然而,由于这些方法使用固定的数据依赖惩罚,他们往往难以在标签和向量分布多样的atasets上进行泛化。本文提出了一种原则方法,直接从数据中学习向量距离与过滤匹配之间最优权衡,而不是依赖固定惩罚。我们将其形式化为受约束的线性优化问题,推导出更能反映底层过滤分布并更有效解决过滤ANN搜索问题的权重。这些学习到的权重指导搜索过程和索引构建,导致更有效地捕捉底层过滤分布和过滤语义的图结构。我们的实验表明,针对数据调整距离函数显著提高了准确率,比固定惩罚方法提高5-10%,为过滤ANN搜索问题提供了更灵活和可泛化的框架。
引用
@article{arxiv.2511.04073,
title = {Learning Filter-Aware Distance Metrics for Nearest Neighbor Search with Multiple Filters},
author = {Ananya Sutradhar and Suryansh Gupta and Ravishankar Krishnaswamy and Haiyang Xu and Aseem Rastogi and Gopal Srinivasa},
journal= {arXiv preprint arXiv:2511.04073},
year = {2025}
}
备注
1st Workshop on Vector Databases at International Conference on Machine Learning, 2025