中文

Smartpick:面向支持无服务器架构的可扩展数据分析系统的工作负载预测

分布式、并行与集群计算 2023-07-26 v1

摘要

许多数据分析系统已采用一种新兴计算资源——无服务器(SL),以及时且经济高效地处理数据分析查询,即无服务器数据分析。虽然这些系统得益于 SL 的敏捷性与可扩展性可快速启动查询处理,但由于 SL 相比传统计算资源(如虚拟机(VM))性能更差且成本更高,它们可能基于工作负载遭遇性能与成本瓶颈。在本项目中,我们提出 Smartpick,一种支持 SL 的可扩展数据分析系统,它协同利用 SL 与 VM 以实现复合收益,即来自 SL 的敏捷性以及来自 VM 的更优性能与更低成本。Smartpick 使用一种机器学习预测方案,即基于决策树的随机森林与贝叶斯优化器,来确定满足成本-性能目标的 SL 与 VM 配置,即查询所需的 SL 与 VM 实例数量。Smartpick 为应用提供一个调节旋钮,使其能探索通过协同利用 SL 与 VM 所开启的更丰富成本-性能权衡空间。为最大化 SL 的收益,Smartpick 支持一种简单而强健的机制,称为中继实例(relay-instances)。Smartpick 还支持事件驱动的预测模型再训练以应对工作负载动态变化。Smartpick 原型在 Spark 上实现并部署于实时测试床 Amazon AWS 与 Google Cloud Platform。评估结果表明预测准确率分别达 97.05% 与 83.49%,相比基线最高降低成本 50%。结果还证实 Smartpick 能让数据分析应用高效导航更丰富的成本-性能权衡空间,并有效且自动地处理工作负载动态。

关键词

引用

@article{arxiv.2307.13677,
  title  = {Smartpick: Workload Prediction for Serverless-enabled Scalable Data Analytics Systems},
  author = {Anshuman Das Mohapatra and Kwangsung Oh},
  journal= {arXiv preprint arXiv:2307.13677},
  year   = {2023}
}

备注

This paper is accepted for publication at the 24th ACM/IFIP International Middleware Conference (Middleware '23)