中文

HPAT:兼具脚本易用性的高性能分析

分布式、并行与集群计算 2017-04-12 v2

摘要

大数据分析需要在大规模集群上同时实现高程序员生产率和高性能。然而,当前的大数据分析框架(如 Apache Spark)由于基于库,存在难以接受的运行时开销。我们引入一种新颖的自动并行化编译器方法,该方法利用了数据分析领域的特性,如 map/reduce 并行模式,并且与以往的自动并行化方法不同,具有鲁棒性。利用这种方法,我们构建了高性能分析工具包(HPAT),它能自动并行化高级脚本(Julia)程序,生成高效的 MPI/C++ 代码,并提供弹性。此外,它还为脚本程序提供自动优化,例如数组操作的融合。因此,在 Cori 超级计算机上,HPAT 比 Spark 快 369 到 2033 倍,在 Amazon AWS 上快 20 到 256 倍。

关键词

引用

@article{arxiv.1611.04934,
  title  = {HPAT: High Performance Analytics with Scripting Ease-of-Use},
  author = {Ehsan Totoni and Todd A. Anderson and Tatiana Shpeisman},
  journal= {arXiv preprint arXiv:1611.04934},
  year   = {2017}
}