中文

基于求和-积网络从数据和查询学习的基数估计统一模型

数据库 2025-05-14 v1

摘要

基数估计是数据库系统中的关键组件,对生成高效执行计划至关重要。尽管学习基数估计取得了进展,现有方法可能在估计精度、推理时间和存储开销三个关键标准上难以同时优化,限制了其在实际数据库环境中的实用性。本文引入 QSPN,一个统一模型,将数据分布和查询工作负载整合在一起。QSPN 通过建模数据分布使用简单而有效的求和-积网络(SPN)结构来实现高估计精度。为确保低推理时间和降低存储开销,QSPN 进一步基于查询访问模式对列进行分区。我们将 QSPN formalize 为一种基于树的结构,通过引入两种新节点类型(QProduct 和 QSplit)来扩展 SPN。本文研究开发 QSPN 的离线构建和在线计算的高效算法的研究挑战。我们进行大量实验,在单表和多表基数估计设置中评估 QSPN。实验结果表明,与最新方法相比,QSPN 在三个关键标准上实现了优越且稳健的性能。

关键词

引用

@article{arxiv.2505.08318,
  title  = {A Unified Model for Cardinality Estimation by Learning from Data and Queries via Sum-Product Networks},
  author = {Jiawei Liu and Ju Fan and Tongyu Liu and Kai Zeng and Jiannan Wang and Quehuan Liu and Tao Ye and Nan Tang},
  journal= {arXiv preprint arXiv:2505.08318},
  year   = {2025}
}

备注

17 pages, 8 figures