中文

大规模系统中用于降低延迟的作业并行模型

概率论 2022-07-22 v2 性能

摘要

在许多现实应用中,在多个处理核上并行处理计算密集型作业至关重要。本文考虑一个理想化的作业并行模型,其中作业可由 dd 个不同的服务器同时服务。当 dd 个服务器对该作业完成的总工作量等于其大小时,该作业被视为完成。我们研究并行对作业平均延迟的影响。具体地,我们分析一个由 nn 个并行处理器共享服务器组成的系统,其中作业按照速率为 nλn \lambda (λ<1\lambda <1) 的泊松过程到达,且每个作业带来单位均值的指数分布工作量。到达时,作业均匀随机地选择 dd 个服务器并同时加入所有被选服务器。我们通过平均场分析表明,对于固定 d2d \geq 2 和大 nn,当 λ1\lambda \to 1 时服务器的平均占用率为 O(log(1/(1λ)))O(\log (1/(1-\lambda))),而 d=1d=1 时平均占用率为 O(1/(1λ))O(1/(1-\lambda))。因此,我们通过并行获得了作业响应时间的指数级降低。我们在严格证明平均场分析方面取得了显著进展。

关键词

引用

@article{arxiv.2203.08614,
  title  = {A Model of Job Parallelism for Latency Reduction in Large-Scale Systems},
  author = {Ayalvadi Ganesh and Arpan Mukhopadhyay},
  journal= {arXiv preprint arXiv:2203.08614},
  year   = {2022}
}