基于学习的自适应唯一值数目估计方法
数据库
2025-03-04 v2
摘要
唯一值数目(Number of Distinct Values, NDV)估计是众多数据管理任务的基础问题,尤其在数据库应用中。然而,现有大多数研究主要关注引入新的统计或学习估计方法,而针对特定情境下识别最合适估计方法的工作仍有限。因此,我们提出 AdaNDV 方法,通过学习选择和融合现有估计方法来适应性地解决此问题。具体而言:(1) 我们提出使用学习模型区分高估和低估的估计方法,然后从每个类别中选择合适的估计方法。这种策略通过整合高估和低估以进行误差校正,从而提高 NDV 估计的准确性。(2) 为进一步整合估计结果,我们引入一种新颖的融合方法,采用学习模型预测所选估计方法的权重,然后对其进行加权求和以合并结果。通过结合这些策略,AdaNDV 显著不同于以直接估计 NDV 的以往方法。此外,在真实数据集上的大规模实验(单个列数目远超以往研究)表明,我们方法的卓越性能。
引用
@article{arxiv.2502.16190,
title = {AdaNDV: Adaptive Number of Distinct Value Estimation via Learning to Select and Fuse Estimators},
author = {Xianghong Xu and Tieying Zhang and Xiao He and Haoyang Li and Rong Kang and Shuai Wang and Linhui Xu and Zhimin Liang and Shangyu Luo and Lei Zhang and Jianjun Chen},
journal= {arXiv preprint arXiv:2502.16190},
year = {2025}
}
备注
Accepted by VLDB 2025