利用列相关性设计简洁辅助索引机制(扩展版)
数据库
2019-04-03 v2
摘要
数据库管理员在关系数据库管理系统(RDBMSs)的数据表上构建辅助索引以加速查询处理。这些索引根据数据统计量构建于最频繁查询的列之上。遗憾的是,在同一数据库中维护多个辅助索引会极度消耗空间,并因内存空间可能耗尽而导致显著的性能下降。本文中,我们证明了存在许多利用列相关性来加速数据访问的机会。我们提出了 HERMIT,一种面向现代 RDBMSs 的简洁辅助索引机制。HERMIT 明智地利用隐藏在列之间的丰富软函数依赖来剪除用于索引键访问的冗余结构。HERMIT 不构建存储键列中每一个条目的完整索引,而是将任何传入的键访问查询导航到建立在相关列上的现有索引。这通过分层回归搜索树(TRS-Tree)实现,这是一种简洁的、机器学习增强的数据结构,可执行快速曲线拟合以自适应且动态地捕获列相关性与离群值。我们在两种不同 RDBMSs 中的广泛实验研究证实,HERMIT 能在查询响应时间和索引维护时间方面以有限性能开销显著减少空间消耗,尤其在支持复杂范围查询时。
引用
@article{arxiv.1903.11203,
title = {Designing Succinct Secondary Indexing Mechanism by Exploiting Column Correlations (Extended Version)},
author = {Yingjun Wu and Jia Yu and Yuanyuan Tian and Richard Sidle and Ronald Barber},
journal= {arXiv preprint arXiv:1903.11203},
year = {2019}
}
备注
To appear in SIGMOD 2019