面向异构数据的分析流水线的设计与实现
分布式、并行与集群计算
2024-04-09 v3
摘要
管理和准备用于深度学习的复杂数据(大规模数据科学中的一种流行方法)可能具有挑战性。用于模型训练的数据传输也带来了困难,影响了基因组学、气候建模和天文学等科学领域。像Google Pathways这样的大规模解决方案为深度学习模型提供了分布式执行环境,但它是专有的。将现有的开源、可扩展运行时工具和数据框架集成到高性能计算(HPC)平台上对于应对这些挑战至关重要。我们的目标是建立一种平滑且统一的方法,将数据工程和深度学习框架与多样化的执行能力相结合,这些框架可以部署在各种高性能计算平台上,包括云和超级计算机。我们旨在支持带有加速器的异构系统,其中Cylon和其他数据工程与深度学习框架可以利用异构执行。为此,我们提出了Radical-Cylon,一个具有并行和分布式数据框架的异构运行时系统,用于将Cylon作为Radical Pilot的任务执行。我们详细解释了Radical-Cylon的设计和开发,以及使用Radical Pilot执行Cylon任务的过程。这种方法使得能够在多个节点上使用异构MPI通信子。Radical-Cylon实现了比裸机Cylon更好的性能,且开销最小且恒定。在执行类似的连接和排序操作时,使用相同的资源处理3500万和35亿行数据,Radical-Cylon的执行时间比批处理执行快4%至15%。该方法旨在在科学和工程研究HPC系统中表现出色,同时在云基础设施上展示稳健的性能。这种双重能力促进了开源科学研究社区内的协作和创新。
引用
@article{arxiv.2403.15721,
title = {Design and Implementation of an Analysis Pipeline for Heterogeneous Data},
author = {Arup Kumar Sarker and Aymen Alsaadi and Niranda Perera and Mills Staylor and Gregor von Laszewski and Matteo Turilli and Ozgur Ozan Kilic and Mikhail Titov and Andre Merzky and Shantenu Jha and Geoffrey Fox},
journal= {arXiv preprint arXiv:2403.15721},
year = {2024}
}
备注
14 pages, 16 figures, 2 tables