中文

证明:利用昂贵谓词加速近似聚合查询

统计理论 2021-07-30 v2 数据库 机器学习 机器学习 统计理论

摘要

给定数据集 D\mathcal{D},我们关注计算 D\mathcal{D} 中匹配某谓词的子集的均值。ABae 利用分层采样和代理模型,在给定采样预算 NN 的情况下高效计算该统计量。在本文中,我们从理论上分析 ABae,并证明其估计的均方误差(MSE)以 O(N11+N21+N11/2N23/2)O(N_1^{-1} + N_2^{-1} + N_1^{1/2}N_2^{-3/2}) 的速率衰减,其中 N=KN1+N2N=K \cdot N_1+N_2KK 为某整数常数,KN1K \cdot N_1N2N_2 分别表示 ABae 第一阶段和第二阶段使用的样本数。因此,若总样本预算 NN 的恒定比例分配给每个阶段,我们将达到 O(N1)O(N^{-1}) 的均方误差,这与在已知各层谓词正例率和标准差先验知识下最优分层采样算法的均方误差速率相匹配。

关键词

引用

@article{arxiv.2107.12525,
  title  = {Proof: Accelerating Approximate Aggregation Queries with Expensive Predicates},
  author = {Daniel Kang and John Guibas and Peter Bailis and Tatsunori Hashimoto and Yi Sun and Matei Zaharia},
  journal= {arXiv preprint arXiv:2107.12525},
  year   = {2021}
}