中文

面向HPC容器化的DMTCP检查点-重启机制优化

分布式、并行与集群计算 2024-07-30 v1 软件工程

摘要

本文对高性能计算(HPC)中的检查点-重启(checkpoint-restart,简称C/R)机制进行深入审查,聚焦于Distributed MultiThreaded CheckPointing(DMTCP)在各种计算环境中的应用,包括容器内外。该研究基于在NERSC Perlmutter超级计算系统上运行的实际应用。我们讨论了C/R在管理HPC中复杂且长时间计算方面的优势,突出其在此类环境中的效率和可靠性。DMTCP在提升这些工作流程方面的作用,尤其是在多线程和分布式应用程序中,得到了彻底的探索。此外,本文深入探讨了HPC容器(如Shifter和Podman-HPC)的使用,这些容器有助于管理计算任务,确保在不同环境中实现一致的性能。本研究的方法、结果以及潜在的未来方向也涵盖了其在各种科学领域中的应用,展示了通过本研究在计算方法学方面所取得的关键性进步。

关键词

引用

@article{arxiv.2407.19117,
  title  = {Optimizing Checkpoint-Restart Mechanisms for HPC with DMTCP in Containers at NERSC},
  author = {Madan Timalsina and Lisa Gerhardt and Nicholas Tyler and Johannes P. Blaschke and William Arndt},
  journal= {arXiv preprint arXiv:2407.19117},
  year   = {2024}
}

备注

9 pages, 4 figures