中文

大规模工作流应用在云函数上执行的性能考量

分布式、并行与集群计算 2019-09-10 v1

摘要

函数即服务(FaaS)是一种用于创建分布式应用和利用计算资源的新型云服务。应用开发者提供云函数的源代码(即小型应用或应用组件),而服务提供商负责基础设施的供应、扩展以及暴露 REST 风格 API。该环境似乎适合运行科学工作流,近年来科学工作流已成为实现和保存复杂科学过程的既定范式。在本文中,我们展示了将三大主要 FaaS 提供商(Amazon、Google、IBM)作为运行科学工作流平台的评估工作。实验使用了一个专门的基准测试框架进行,该框架由插桩化的工作流执行引擎组成。测试负载以大规模任务包(bag-of-tasks)风格工作流实现,任务数达到 5120 个并行运行。所研究的参数包括原始性能、基础设施供应的效率、API 和网络层引入的开销,以及与运行时间计费相关的方面。结论包含对可用性能的洞察,以原始 GFlops 值和描述性能与函数大小关系的图表表示。基础设施供应被证明受并行度和速率限制支配,这可从包含的图表中推断。使用 REST API 带来的开销被证明是对单个任务乃至整个工作流总运行时间的显著贡献。本文最后指出了可能的未来工作,包括构建性能模型和设计用于在 FaaS 上运行科学工作流的专用调度算法。

关键词

引用

@article{arxiv.1909.03555,
  title  = {Performance considerations on execution of large scale workflow applications on cloud functions},
  author = {Maciej Pawlik and Kamil Figiela and Maciej Malawski},
  journal= {arXiv preprint arXiv:1909.03555},
  year   = {2019}
}