中文

Spark中带误差界的近似计算

分布式、并行与集群计算 2019-06-07 v3 数据库

摘要

我们引入了一个采样框架,以支持Spark中带估计误差界的近似计算。我们的框架允许在一系列以聚合操作结尾的多个转换之前进行采样。该框架随着计算推进构建数据溯源树,然后将该树与多阶段采样和总体估计理论结合,以计算聚合的误差界。当输出键的信息较早可用时,该框架还可使用自适应分层蓄水池采样,以避免(或减少)最终输出中的键丢失,并在热门与稀有键之间实现更一致的误差界。最后,该框架包含一种算法,可动态选择采样率以满足用户对输出中误差界CDF的指定约束。我们实现了该框架的原型ApproxSpark,并用其实现了来自不同领域的五个近似应用。评估结果表明,ApproxSpark能够(a)在用户可容忍少量不确定性和许多情况下稀有键丢失时显著减少执行时间,以及(b)自动寻找采样率以满足用户对误差界的指定约束。我们还广泛探讨并讨论了采样率、执行时间、精度与键丢失之间的权衡。

关键词

引用

@article{arxiv.1812.01823,
  title  = {Approximation with Error Bounds in Spark},
  author = {Guangyan Hu and Desheng Zhang and Sandro Rigo and Thu D. Nguyen},
  journal= {arXiv preprint arXiv:1812.01823},
  year   = {2019}
}