中文

k-means 在分布式近似相似搜索中的非常规应用

信息检索 2022-08-05 v1

摘要

度量空间中基于距离函数的相似搜索是许多应用的基本问题。相似对象的查询引出了著名的机器学习任务——最近邻识别。在此背景下,已提出许多统称为度量访问方法(MAM)的数据索引策略,以加速相似元素的查询。此外,由于解决相似查询的精确方法可能复杂且耗时,出现了减少查询执行时间的替代方案,例如返回近似结果或借助分布式计算平台。在本文中,我们介绍 MASK(基于 kk-means 的多级近似相似搜索),一种将 kk-means 算法非常规地用作度量空间中近似相似搜索多级索引结构基础的方案。我们表明,kk-means 的固有特性(如用更少原型表示高密度数据区域)可被用于此目的。我们使用合成数据集和高维高稀疏空间中的真实数据集,对该新索引方法的实现进行了评估。结果令人鼓舞,并支撑了该新颖索引方法在多领域的适用性。

关键词

引用

@article{arxiv.2208.02734,
  title  = {Unconventional application of k-means for distributed approximate similarity search},
  author = {Felipe Ortega and Maria Jesus Algar and Isaac Martín de Diego and Javier M. Moguerza},
  journal= {arXiv preprint arXiv:2208.02734},
  year   = {2022}
}

备注

36 pages, 17 figures, currently under peer review