分布式环境下基于采样的不同值数量估计
数据库
2022-06-14 v1
摘要
在数据挖掘中,估计不同值数量(NDV)是一基础问题,有着广泛应用。现有 NDV 估计方法可大致分为两类:i) 基于扫描的方法,扫描全部数据并维护草图以近似 NDV;ii) 基于采样的方法,利用采样数据而非访问整个数据仓库来估计 NDV。基于扫描的方法以更高 I/O 与更长时间为代价获得更低近似误差。基于采样的估计因更高可扩展性,在大数据量且允许误差限制的应用中更受青睐。然而,尽管基于采样的方法在单机更有效,其在海量数据的分布式环境中实用性较低。为获得最终 NDV 估计量,整个样本须在分布式系统中传输,当采样率显著时产生 prohibitive 通信开销。本文提出一种新颖基于草图的分布式方法,在温和假设下实现分布式基于采样 NDV 估计的次线性通信开销。我们的方法利用基于草图的算法在分布式流模型中估计样本的频率之频率,其与多数经典基于采样的 NDV 估计量兼容。此外,我们给出理论证据,证明该方法在最坏情形下最小化通信开销的能力。大量实验表明,与现有基于采样与基于草图的方法相比,我们的方法在通信开销上节省数个数量级。
引用
@article{arxiv.2206.05476,
title = {Sampling-based Estimation of the Number of Distinct Values in Distributed Environment},
author = {Jiajun Li and Zhewei Wei and Bolin Ding and Xiening Dai and Lu Lu and Jingren Zhou},
journal= {arXiv preprint arXiv:2206.05476},
year = {2022}
}
备注
11 pages