中文

基于任务采样的学习用于集群作业调度的案例

分布式、并行与集群计算 2021-11-17 v2

摘要

准确估计作业运行时属性的能力使调度器能够有效地调度作业。最先进的在线集群作业调度器使用基于历史的学习,即利用过去的作业执行信息来估计新到达作业的运行时属性。然而,随着集群技术(硬件和软件)的快速发展和用户输入的变化,作业运行时属性可能随时间改变,从而导致预测不准确。在本文中,我们通过主动采样和调度每个作业的一小部分任务,探索了实时学习作业运行时属性的潜力和局限性。这种基于任务采样的方法利用了同一作业各任务运行时属性之间的相似性,并且本质上不受作业行为变化的影响。我们的研究聚焦于比较基于任务采样的学习(空间中的学习)和基于历史的学习(时间中的学习)的两个关键问题:(1) 空间中的学习能否比时间中的学习更准确?(2) 如果能,将作业剩余任务的调度延迟到采样任务完成之后,其带来的性能提升能否补偿延迟的代价,从而改善作业性能?我们对 3 条具有不同倾斜度和作业分布的生产轨迹的分析和实验分析表明,空间中的学习可以显著地更准确。我们在 Azure 上对锚定于一个通用作业调度器的两种学习方法,使用 3 条生产集群作业轨迹进行的仿真和测试平台评估表明,尽管存在在线开销,空间中的学习相比最先进的基于历史的预测器,将平均作业完成时间 (JCT) 分别降低了 1.28 倍、1.56 倍和 1.32 倍。

关键词

引用

@article{arxiv.2108.10464,
  title  = {The Case for Task Sampling based Learning for Cluster Job Scheduling},
  author = {Akshay Jajoo and Y. Charlie Hu and Xiaojun Lin and Nan Deng},
  journal= {arXiv preprint arXiv:2108.10464},
  year   = {2021}
}