利用昂贵谓词加速近似聚合查询
数据库
2021-08-16 v1
摘要
研究人员和行业分析师越来越关注在大型非结构化数据集上计算带有选择性谓词的聚合查询,这些谓词使用昂贵的深度神经网络(DNN)计算。由于这些DNN代价高昂,且许多应用可容忍近似答案,分析师希望通过近似加速这些查询。遗憾的是,标准的近似查询处理技术无法用于加速此类查询,因为它们假设谓词结果事先可用。此外,近期使用廉价近似(即代理)的工作不支持带谓词的聚合查询。为加速带昂贵谓词的聚合查询,我们开发并分析了一种利用代理(ABae)的查询处理算法。ABae必须应对的关键挑战是:它可能采样到不满足谓词的记录。为应对该挑战,我们首先使用代理将记录分组为层,使满足谓词的记录理想情况下被分到少数层中。给定这些层后,ABae使用试点采样和插件估计按最优分配进行采样。我们在一个针对可能不满足谓词的抽样的分层采样的新分析中证明ABae以最优速率收敛。我们进一步表明,ABae在六个真实世界数据集上优于基线,将标注成本降低多达2.3倍。
引用
@article{arxiv.2108.06313,
title = {Accelerating Approximate Aggregation Queries with Expensive Predicates},
author = {Daniel Kang and John Guibas and Peter Bailis and Tatsunori Hashimoto and Yi Sun and Matei Zaharia},
journal= {arXiv preprint arXiv:2108.06313},
year = {2021}
}