中文

一种用于度量空间中精确相似搜索的学习索引

数据库 2022-08-01 v2 机器学习

摘要

索引是支持大型数据库中高效查询处理的有效方式。近来,学习索引(即用机器学习模型替代或补充传统索引结构)的概念被积极探讨,以降低存储与搜索成本。然而,高维度量空间中准确且高效的相似查询处理仍是一项开放挑战。本文提出一种称为 LIMS 的新型索引方法,其利用数据聚类、基于枢轴的数据转换技术以及学习索引,支持度量空间中的高效相似查询处理。在 LIMS 中,底层数据被划分为若干簇,使得每个簇遵循相对均匀的数据分布。通过为每个簇使用少量枢轴实现数据重分布。相似数据被映射至紧凑区域,且映射值完全有序。我们开发机器学习模型以近似每条数据记录在磁盘上的位置。基于 LIMS 设计了处理范围查询与最近邻查询的高效算法,以及支持动态更新的索引维护方法。在真实与合成数据集上的大量实验表明了 LIMS 相较于传统索引与最先进学习索引的优越性。

关键词

引用

@article{arxiv.2204.10028,
  title  = {A Learned Index for Exact Similarity Search in Metric Spaces},
  author = {Yao Tian and Tingyun Yan and Xi Zhao and Kai Huang and Xiaofang Zhou},
  journal= {arXiv preprint arXiv:2204.10028},
  year   = {2022}
}

备注

14 pages, 13 figures, submitted to Transactions on Knowledge and Data Engineering