中文

d 种选择在异构服务器数据中心调度中的威力

性能 2019-04-02 v1

摘要

MapReduce 框架是大数据及其应用中的事实标准,其中大数据集被拆分为小数据块并在数千台服务器间于不同服务器上复制。系统的异构服务器结构使得调度比同构服务器系统的调度困难得多。一方面系统的吞吐量最优性,另一方面延迟最优性,在为任务分配服务器时造成了两难。JSQ-MaxWeight 与 Balanced-Pandas 算法是具有两层与三层数据局部性系统吞吐量及延迟最优性理论保证的当前最优算法。然而,这两种算法的调度复杂度过高。因此,我们采用 d 种选择算法结合 Balanced-Pandas 算法与 JSQ-MaxWeight 算法,并比较简单算法及其 d 种选择版本的复杂度。我们进一步展示,结合 d 种选择的 Balanced-Pandas 算法(Balanced-Pandas-Pod)不仅比简单 Balanced-Pandas 表现更好,而且对参数 d 的敏感度低于 JSQ-MaxWeight 算法与 d 种选择结合的版本(JSQ-MaxWeight-Pod)。事实上,在我们广泛的仿真结果中,Balanced-Pandas-Pod 算法在低负载与中负载(数据中心通常运行于此区间)下比简单 Balanced-Pandas 算法表现更好,而在高负载下与 Balanced-Pandas 算法表现几乎相同。需注意,Balanced-Pandas 与 JSQ-MaxWeight 算法的负载均衡复杂度为 O(M),其中 M 为系统中服务器数量(达数千台量级),而 Balanced-Pandas-Pod 与 JSQ-MaxWeight-Pod 的复杂度为 O(1),这使得中心调度器更快并节省能源。

关键词

引用

@article{arxiv.1904.00447,
  title  = {The Power of d Choices in Scheduling for Data Centers with Heterogeneous Servers},
  author = {Amir Moaddeli and Iman Nabati Ahmadi and Negin Abhar},
  journal= {arXiv preprint arXiv:1904.00447},
  year   = {2019}
}