中文

PGM-index:一种多准则、压缩且基于学习的数据索引方法

数据结构与算法 2020-05-08 v1 数据库 信息检索 机器学习

摘要

近来引入的学习索引(learned indexes)动摇了具有数十年历史的数据结构索引领域的基础。将 B 树节点等经典设计元素与机器学习模型结合甚至替换,已被证明能极大改善数据系统的空间占用和时间效率。然而,这些新方法基于启发式策略,因而在时间和空间需求上均缺乏任何保证。我们提出分段几何模型索引(Piecewise Geometric Model index,简称 PGM-index),它在查询操作中实现有保证的 I/O 最优性,学习最优数量的线性模型,且其独特的递归构造使它成为纯粹的学习数据结构,而非传统索引与学习索引的混合体(如 RMI 和 FITing-tree)。我们表明,PGM-index 将 FITing-tree 的空间缩减 63.3%,将 B 树的空间缩减超过四个数量级,同时达到相同或更优的查询时间效率。我们进一步提出 PGM-index 的三种变体以补充该结果。首先,我们设计了一种压缩 PGM-index,通过利用其组成的已学习线性模型层面的重复性进一步降低空间占用。其次,我们设计了一种自适应查询分布的 PGM-index,从而成为迄今首个已知的分布感知学习索引。最后,鉴于其在空间-时间权衡上提供的灵活性,我们提出多准则 PGM-index,能在数秒内针对数亿个键高效自动调优,以适应应用可能演化的空间-时间约束。我们提醒读者,本文是我们先前论文“通过编排学习与几何超越传统索引”(arXiv:1903.00507)的扩展与改进版本。

关键词

引用

@article{arxiv.1910.06169,
  title  = {The PGM-index: a multicriteria, compressed and learned approach to data indexing},
  author = {Paolo Ferragina and Giorgio Vinciguerra},
  journal= {arXiv preprint arXiv:1910.06169},
  year   = {2020}
}

备注

We remark to the reader that this paper is an extended and improved version of our previous paper titled "Superseding traditional indexes by orchestrating learning and geometry" (arXiv:1903.00507)