中文

在 Cray XC 与 CS 系列超级计算机上运行 Alchemist:Dask 与 PySpark 接口、部署选项及数据传输时间

分布式、并行与集群计算 2019-12-02 v2

摘要

Alchemist 是一个通过接入 HPC 库进行大规模分布式计算以使 Apache Spark 获得更佳性能的系统。在本文中,我们重点介绍 Alchemist 中令 Cray 用户及广大科学界感兴趣的一些近期进展。我们讨论了将 Alchemist 移植到容器镜像并部署于 Cray XC(使用 Shifter)与 CS(使用 Singularity)系列超级计算机以及本地 Kubernetes 集群上的经验。新开发的 Python、Dask 与 PySpark 接口使得 Alchemist 能够与更多的数据分析框架协同使用。我们还简要讨论了 Alchemist 与日益流行的强化学习库 RLlib 的结合,并考量在强化学习中利用 HPC 仿真的益处。最后,由于客户端应用与 Alchemist 之间的数据传输是 Alchemist 所面临的主要开销,我们针对这些传输时间相对于不同因素给出了定性评估。

关键词

引用

@article{arxiv.1910.01354,
  title  = {Running Alchemist on Cray XC and CS Series Supercomputers: Dask and PySpark Interfaces, Deployment Options, and Data Transfer Times},
  author = {Kai Rothauge and Haripriya Ayyalasomayajula and Kristyn J. Maschhoff and Michael Ringenburg and Michael W. Mahoney},
  journal= {arXiv preprint arXiv:1910.01354},
  year   = {2019}
}

备注

This work appeared at CUG 2019