利用位置序列模式估计 SQL LIKE 查询的选择率
数据库
2020-02-05 v1 数据结构与算法
摘要
随着基于文本的数据量急剧增长(这类数据通常包含拼写错误及其他错误),使用灵活搜索模式查询此类数据变得越来越普遍。关系数据库支持 LIKE 操作符以允许使用特定通配符谓词进行搜索(例如 LIKE 'Sub%',匹配所有以 'Sub' 开头的字符串)。由于文本数据规模庞大,以最优方式执行此类查询对数据库性能十分关键。在为 LIKE 查询构建最高效执行计划时,查询优化器需要灵活模式查询谓词的选择率估计。近来提出的 SPH 算法采用基于序列模式的直方图结构来估计 LIKE 查询的选择率。SPH 方法的一个缺陷是常会高估查询选择率。为缓解该高估问题,本文提出一种称为位置序列模式的新序列模式类型。所提模式区分了在所有模式出现中彼此相邻的序列项对与那些中间可能隔有其他项的序列项对。此外,我们在直方图构建时基于模式信息量进行冗余模式消除。最后,我们在选择率估计时提出基于分区的匹配方案。在 DBLP 真实数据集上的实验结果表明,所提方法在错误率上比当前最优方法提升约 20%。
引用
@article{arxiv.2002.01164,
title = {Using Positional Sequence Patterns to Estimate the Selectivity of SQL LIKE Queries},
author = {Mehmet Aytimur and Ali Cakmak},
journal= {arXiv preprint arXiv:2002.01164},
year = {2020}
}