Tsunami:一种面向相关数据与时变偏斜工作负载的学习型多维索引
数据库
2020-06-25 v1 机器学习
摘要
基于谓词过滤数据是任何现代数据仓库最基本操作之一。加速过滤表达式执行的技术包括聚簇索引、专用排序顺序(如Z-order)、多维索引,以及针对高选择性查询的二级索引。然而,这些方案难以调优且性能不稳定。近期关于学习型多维索引的研究引入了为特定数据集和工作负载自动优化索引的思路。但该工作的性能在相关数据与时斜查询工作负载(二者在真实应用中均很常见)存在时表现不佳。本文提出Tsunami,它解决了这些局限,相比现有学习型多维索引实现了高达6倍更快的查询性能和高达8倍更小的索引尺寸,此外相比最优调优的传统索引实现了高达11倍更快的查询性能和170倍更小的索引尺寸。
引用
@article{arxiv.2006.13282,
title = {Tsunami: A Learned Multi-dimensional Index for Correlated Data and Skewed Workloads},
author = {Jialin Ding and Vikram Nathan and Mohammad Alizadeh and Tim Kraska},
journal= {arXiv preprint arXiv:2006.13282},
year = {2020}
}