中文

Hercules:应对数据序列相似性搜索

数据库 2022-12-29 v1

摘要

我们提出 Hercules,一种用于大规模基于磁盘的数据序列集合上精确相似性搜索的并行树形技术。我们呈现了新颖的索引构建与查询应答算法,其利用不同的摘要技术、仔细调度高代价操作、优化内存与磁盘访问,并发挥现代硬件的多线程与 SIMD 能力来执行 CPU 密集型计算。我们使用多个合成与真实数据集以及不同难度的查询工作负载,针对最先进技术进行了广泛的实验评估,证明了 Hercules 的优越性与鲁棒性。结果表明,Hercules 比最佳竞争者(并非总是同一者)快达一个数量级。此外,Hercules 是唯一在所有场景(包括基于磁盘数据集上的困难查询工作负载)中均优于优化扫描的索引。本文发表于 Proceedings of the VLDB Endowment,第 15 卷第 10 期,2022 年 6 月。

关键词

引用

@article{arxiv.2212.13297,
  title  = {Hercules Against Data Series Similarity Search},
  author = {Karima Echihabi and Panagiota Fatourou and Kostas Zoumpatianos and Themis Palpanas and Houda Benbrahim},
  journal= {arXiv preprint arXiv:2212.13297},
  year   = {2022}
}