中文

面向科学工作流的在线任务内存需求预测:Ponder

分布式、并行与集群计算 2024-10-11 v2

摘要

科学工作流用于分析大量数据。这些工作流包含大量任务,其中许多任务会重复执行,针对不同的输入运行相同的自定义程序。用户为每个任务指定资源分配,这些资源必须足以防止所有输入导致任务失败。结果是,任务内存分配倾向于过于保守,浪费宝贵的集群资源,限制整体并行度,增加工作流制盡时间。在本文中,我们首先对来自 nf-core 工作流存储库的四个真实工作流上的最新方法进行基准测试。此分析揭示了当前预测方法所基于的某些假设(这些方法通常仅在模拟工作流上进行评估)在真实工作流和执行环境下通常无法成立。我们然后提出了 Ponder,一种新的在线任务规模策略,考虑并在不同内存需求模式下进行选择。我们为 Nextflow 实现了 Ponder 并使代码公开。在一种考虑内存预测对调度影响的实验评估中,Ponder 在平均情况下比最新方法提高了 71.0% 的内存分配质量,并缩短了 21.8% 的制盡时间。此外,Ponder 产生了 93.8% 更少的任务失败。

关键词

引用

@article{arxiv.2408.00047,
  title  = {Ponder: Online Prediction of Task Memory Requirements for Scientific Workflows},
  author = {Fabian Lehmann and Jonathan Bader and Ninon De Mecquenem and Xing Wang and Vasilis Bountris and Florian Friederici and Ulf Leser and Lauritz Thamsen},
  journal= {arXiv preprint arXiv:2408.00047},
  year   = {2024}
}