基于公有云计算与Hadoop Hive的天文数据档案系统预可行性研究
天体物理仪器与方法
2016-11-21 v1
摘要
天文观测数据的规模逐年增长。例如,阿塔卡马大型毫米波/亚毫米波阵列预计每年产生 200 TB 原始数据,而大型综合巡天望远镜估计每晚产生 15 TB 原始数据。由于计算能力的增长率远低于天文数据的增长率,在未来十年内,将高性能计算(HPC)资源与科学数据一同提供将成为常态。然而,HPC系统的安装与维护成本对提供方而言可能构成沉重负担。我注意到公有云计算可作为低成本获取充足计算资源的替代途径。我利用虚拟专用服务器(VPS)服务和 Amazon Elastic MapReduce (EMR) 搭建了 Hadoop 和 Hive 集群,并测量了它们的性能。VPS集群的性能日间波动较大,而EMR集群则相对稳定。由于分区对Hive至关重要,我评估了多种分区算法。本文报告了基准测试的结果以及云计算环境中的性能优化。
引用
@article{arxiv.1611.06039,
title = {Pre-feasibility Study of Astronomical Data Archive Systems Powered by Public Cloud Computing and Hadoop Hive},
author = {Satoshi Eguchi},
journal= {arXiv preprint arXiv:1611.06039},
year = {2016}
}
备注
4 pages, 2 figures, proceedings of the Astronomical Data Analysis Software and Systems Conference XXVI