HPC上的Hadoop:集成Hadoop与基于Pilot的动态资源管理
分布式、并行与集群计算
2016-02-02 v1
摘要
诸如超级计算机之类的高性能计算平台传统上被设计为满足科学应用的计算需求。因此,它们被构建为数据的生产者而非消费者。Apache Hadoop生态系统已演进以满足数据处理应用的需求,并解决了HPC平台的许多局限性。然而,存在一类科学应用需要传统高性能计算环境与Apache Hadoop生态系统的综合能力。例如,生物分子动力学、基因组学和网络科学等科学领域需要将传统计算与基于Hadoop/Spark的分析相耦合。我们研究了如何向此类科学应用呈现两种计算环境能力的关键问题。尽管该问题需要在多个层面回答,我们聚焦于可能支持两者需求的资源管理中间件的设计。我们提出对Pilot抽象(Pilot-Abstraction)的扩展以提供统一的资源管理层。这是允许应用将HPC阶段(例如仿真)与数据分析相集成的重要一步。许多超级计算中心已开始正式支持Hadoop环境,无论是在专用环境中还是在使用诸如myHadoop等工具的混合部署中。这通常涉及许多需要掌握的固有的、环境特定的细节,并且常常掩盖了概念性问题,如:如何最佳地耦合HPC和Hadoop应用阶段?如何探索运行时权衡(数据局部性 vs. 数据移动)?本文为HPC与Hadoop环境的集成使用提供了概念理解和实际解决方案。
引用
@article{arxiv.1602.00345,
title = {Hadoop on HPC: Integrating Hadoop and Pilot-based Dynamic Resource Management},
author = {Andre Luckow and Ioannis Paraskevakos and George Chantzialexiou and Shantenu Jha},
journal= {arXiv preprint arXiv:1602.00345},
year = {2016}
}