中文

面向 Apache Spark 的 FITS 数据源

天体物理仪器与方法 2018-10-17 v2 分布式、并行与集群计算

摘要

我们研究了集群计算框架 Apache Spark 在分析未来 LSST 类星系巡天数据时的性能。Apache Spark 试图解决大数据问题,迄今为止在工业界已被证明是成功的,但其在天文界的使用仍然有限。我们展示了如何在分布式环境中管理天体物理实验中处理的复杂二进制数据结构,例如存储在 FITS 文件中的二进制表。为此,我们首先设计并实现了一种用于处理任意大 FITS 文件集合的 Spark 连接器,称为 spark-fits。其用户界面使得将文件简单“拖放”到集群即可充分利用该框架。我们使用 LSST 快速模拟工具 CoLoRe 展示了 spark-fits 的极高可扩展性,并提出了在位于巴黎第十一大学(Université Paris Sud)的 Cloud@VirtualData 上测量和调优工作负载性能瓶颈的方法,可扩展至 TB 级 FITS 数据。我们还在位于 NERSC、被广泛用于科学界的高性能计算系统 Cori 上评估了其性能。

关键词

引用

@article{arxiv.1804.07501,
  title  = {FITS Data Source for Apache Spark},
  author = {Julien Peloton and Christian Arnault and Stéphane Plaszczynski},
  journal= {arXiv preprint arXiv:1804.07501},
  year   = {2018}
}

备注

9 pages, 6 figures. Package available at https://github.com/astrolabsoftware/spark-fits Accepted in Computing and Software for Big Science