中文

高性能计算 I/O 机器学习模型中的错误来源分类法

分布式、并行与集群计算 2022-04-19 v1 性能

摘要

I/O 效率对科学计算中的生产力至关重要,但系统与应用日益复杂,使从业者难以理解和大规模优化 I/O 行为。数据驱动的基于机器学习的 I/O 吞吐模型提供了一种解决方案:它们可用于识别瓶颈、自动调优 I/O 或优化作业调度,且只需最少的人工干预。遗憾的是,当前最先进的 I/O 模型尚不足以稳健地用于生产环境,部署后表现不佳。我们分析了两个领军级 HPC 平台上多年的应用、调度器与存储系统日志,以理解 I/O 模型为何在实践中表现不佳。我们提出一种由五类 I/O 建模错误构成的分类法:应用与系统建模不佳、数据集覆盖不足、I/O 争用以及 I/O 噪声。我们开发了石蕊测试来量化每一类,使研究人员能够缩小故障模式范围、增强 I/O 吞吐模型并改进下一代 HPC 日志与分析工具。

关键词

引用

@article{arxiv.2204.08180,
  title  = {A Taxonomy of Error Sources in HPC I/O Machine Learning Models},
  author = {Mihailo Isakov and Mikaela Currier and Eliakin del Rosario and Sandeep Madireddy and Prasanna Balaprakash and Philip Carns and Robert B. Ross and Glenn K. Lockwood and Michel A. Kinsy},
  journal= {arXiv preprint arXiv:2204.08180},
  year   = {2022}
}