中文

用户为何终止 HPC 作业?

分布式、并行与集群计算 2019-10-22 v2

摘要

鉴于 HPC 集群的成本,充分利用它们对改善基础设施投资回报率(ROI)至关重要。同样,减少失败的 HPC 作业以及相关的用户等待时间方面的浪费,对提升 HPC 用户生产力(即人力 ROI)至关重要。尽管大多数努力(例如调试 HPC 程序)探索技术层面以改善 HPC 集群的 ROI,我们假设非技术(人为)方面值得探索以取得非平凡 ROI 收益;具体而言,理解非技术方面及其如何导致 HPC 作业的失败。在这方面,我们在堪萨斯州立大学的 Beocat 集群背景下进行了案例研究。该研究的目的是了解用户终止作业的原因,并从系统利用率和用户等待时间角度量化此类作业中浪费的计算。案例研究的数据有助于识别用户终止 HPC 作业的有趣且可操作的原因。它也帮助确认用户终止的作业可能与非平凡数量的计算浪费相关,若减少此类浪费可有助于改善 HPC 集群的 ROI。

关键词

引用

@article{arxiv.1805.01177,
  title  = {Why do Users Kill HPC Jobs?},
  author = {Venkatesh-Prasad Ranganath and Daniel Andresen},
  journal= {arXiv preprint arXiv:1805.01177},
  year   = {2019}
}

备注

Minor formatting and content update based on reader feedback