增量计算与近似计算的结合
分布式、并行与集群计算
2016-11-28 v1
摘要
大多数需要低延迟执行和高效利用计算资源的数据分析系统,日益采用两种计算范式,即增量计算和近似计算。增量计算在作业输入发生变化而连续运行时,增量更新输出,而非从头重新计算所有内容。近似计算返回作业的近似输出而非精确输出。两种范式都依赖于对数据项子集而非整个数据集进行计算,但它们跳过部分计算的方式不同。增量计算依赖于子计算中间结果的记忆化,并在作业间重用这些记忆化结果以用于不受输入变化影响的子计算。近似计算依赖于对整个数据集的代表性采样,以在数据项子集上计算。在本论文中,我们观察到这两种计算范式是互补的,并且可以结合在一起!其高层思路是:设计一种采样算法,使样本选择偏向于先前运行的记忆化数据项。为具体化该思路,我们设计了一种在线分层采样算法,该算法利用自调节计算产生具有有界误差的增量更新的近似输出。我们在基于Apache Spark Streaming的名为IncAppox的数据分析系统中实现了我们的算法。我们对系统的评估表明,IncApprox实现了增量计算和近似计算两者的益处。
引用
@article{arxiv.1611.08573,
title = {The Marriage of Incremental and Approximate Computing},
author = {Dhanya R Krishnan},
journal= {arXiv preprint arXiv:1611.08573},
year = {2016}
}
备注
http://dl.acm.org/citation.cfm?id=2883026