面向 IoT 生态系统的近似边缘分析
分布式、并行与集群计算
2018-05-16 v1
摘要
支持 IoT 的设备持续产生海量数据。将这种持续到达的原始数据转化为及时洞察对许多现代在线服务至关重要。对于此类场景,在整个数据集上进行传统形式的数据分析对于支持实时流分析而言将具有极大的局限性和高昂的成本。在这项工作中,我们提出了在 IoT 环境下进行数据分析的近似计算的方案。近似计算旨在高效执行工作流,其中近似输出即可满足需求而非精确输出。近似计算背后的思想是对代表性样本进行计算,而不是对整个输入数据集进行计算。因此,近似计算可以基于所选样本大小,在输出精度和计算效率之间进行系统性权衡。这促使了 APPROXIOT 的设计——一个用于 IoT 中近似计算的数据分析系统。为了实现这一想法,我们设计了一种在线分层分层蓄水池抽样算法,该算法利用边缘计算资源产生具有严格误差界限的近似输出。为了展示我们算法的有效性,我们基于 Apache Kafka 实现了 APPROXIOT,并使用一组微基准测试和真实世界案例研究评估了其有效性。结果表明,与简单随机抽样相比,APPROXIOT 在 80% 到 10% 的不同抽样比例下实现了 1.3 倍至 9.9 倍的加速。
引用
@article{arxiv.1805.05674,
title = {Approximate Edge Analytics for the IoT Ecosystem},
author = {Zhenyu Wen and Do Le Quoc and Pramod Bhatotia and Ruichuan Chen and Myungjin Lee},
journal= {arXiv preprint arXiv:1805.05674},
year = {2018}
}