基于聚类的近似最近邻搜索的学习排序方法
信息检索
2024-07-15 v1
摘要
现代信息检索中的关键环节是近似最近邻搜索。其目标是返回与查询点最接近的k个数据点,准确性以捕获返回集合中精确最近邻的比例来衡量。一种流行的方法是聚类:索引算法将数据点划分为不相交的子集,并将每个分区表示为诸如其质心之类的点。查询处理算法首先识别最近的聚类——这一过程称为路由——然后仅在这些聚类上执行最近邻搜索。在本文中,我们提出了一个简单观察:路由函数解决了一个排序问题。其质量因此可以用排序指标进行评估,使其更适合学习排序。有趣的是,往往可以轻易获得 ground-truth:给定查询分布在top-k配置下,ground-truth是包含确切top-k向量的聚类集合。我们发展了这一洞见并将其应用于最大内积搜索(MIPS)。我们在各种数据集上进行实证演示,学习一个简单的线性函数始终可以提高基于聚类的MIPS的准确性。
引用
@article{arxiv.2404.11731,
title = {A Learning-to-Rank Formulation of Clustering-Based Approximate Nearest Neighbor Search},
author = {Thomas Vecchiato and Claudio Lucchese and Franco Maria Nardini and Sebastian Bruch},
journal= {arXiv preprint arXiv:2404.11731},
year = {2024}
}