Coconut:一种可扩展的自底向上构建数据序列索引方法
数据库
2020-06-25 v1
摘要
许多现代应用产生海量数据序列需加以分析,要求高效的相似性搜索操作。然而,用于此目的的最先进数据序列索引在性能或存储成本方面对海量数据集扩展性不佳。我们将问题归结为:现有用于索引的数据序列摘要无法在排序时保持相似数据序列在排序次序中彼此邻近。这导致两个设计问题。首先,无法使用基于排序的传统批量加载算法。相反,索引构建通过缓慢的自顶向下插入进行,产生非连续索引并引发大量随机 I/O。其次,数据序列无法依据其中值排序并均匀拆分到各节点;因此实践中多数叶节点近乎空置。这进一步拖慢查询速度并放大存储成本。为解决这些问题,我们提出 Coconut。Coconut 的首个创新是一种倒排、可排序的数据序列摘要,基于 z-order 曲线组织数据序列,使相似序列在排序次序中彼此邻近。因此,Coconut 能够使用依赖排序的批量加载技术,借助大型顺序磁盘 I/O 快速构建连续索引。随后我们探索了用于自底向上批量加载的基于前缀与基于中值的拆分策略,表明基于中值的拆分优于现有最优方法,确保所有节点被密集填充。总体而言,我们通过分析与实验表明,Coconut 在构建速度、查询速度和存储成本上均主导最先进的数据序列索引。
引用
@article{arxiv.2006.13713,
title = {Coconut: a scalable bottom-up approach for building data series indexes},
author = {Haridimos Kondylakis and Niv Dayan and Kostas Zoumpatianos and Themis Palpanas},
journal= {arXiv preprint arXiv:2006.13713},
year = {2020}
}
备注
arXiv admin note: substantial text overlap with arXiv:2006.11474