LEARNT:LIKE查询基数估计器,具形式准确性保证
数据库
2026-05-26 v1
摘要
我们研究LIKE查询在字符串数据上的基数估计问题,聚焦于真实工作负载中最常见的模式:前缀、后缀和子串查询。我们提出LEARNT,一个具备准确性、鲁棒性、开销可忽略、可调节性和理论保证的LIKE查询估计器。LEARNT将估计形式化为bucket分类问题,正确分类后可为非空答案查询给出Q-error的形式界限。它采用内存高效的bucket化分层过滤架构,结合布隆过滤器和紧凑辅助表,同时利用查询偏斜进行存储优化。对于答案为空的查询,LEARNT集成了专用过滤器化和前缀步行策略,提供正确识别的概率保证。此外,为支持任意长度的查询字符串,我们扩展LEARNT采用马尔可夫建模方案,将短查询统计组合构成长查询的估计。理论框架引导参数选择,以在准确性和鲁棒性约束下最小化存储。广泛实验表明,LEARNT在四个真实数据集上持续优于CLIQUE和LPLM等最先进方法,实现1.3-1.7倍更低的平均Q-error,显著降低尾部误差,并实现最高70倍更快的构建速度,同时在可比存储使用下保持竞争力。
引用
@article{arxiv.2605.24308,
title = {LEARNT: A Practical Estimator for Cardinality of LIKE Queries with Formal Accuracy Guarantees},
author = {Hai Lan and Zhifeng Bao and Divesh Srivastava and Shixun Huang and Yuwei Peng and Yang Yu},
journal= {arXiv preprint arXiv:2605.24308},
year = {2026}
}
备注
13 pages, 4 figures, 15 tables