中文

Coflow 调度中基于采样学习技术的案例研究

分布式、并行与集群计算 2022-01-27 v3

摘要

Coflow 调度通过改善网络性能来提高数据密集型应用的性能。最先进的在线 coflow 调度器本质上是通过在线学习 coflow 大小来近似经典的短作业优先 (SJF) 调度。具体而言,它们使用多个优先级队列来同时实现两个目标:从短 coflow 中筛出长 coflow,并以高优先级调度短 coflow。这种机制在学习 coflow 大小时付出了高昂的开销:在队列间移动大型 coflow 会延迟小型和其他大型 coflow,而在队列间移动大小相似的 coflow 会导致无意的轮询调度。我们提出 Philae,一种新的在线 coflow 调度器,它利用 coflow 的空间维度,即一个 coflow 包含多个流,来大幅降低 coflow 大小学习的开销。Philae 对每个 coflow 的采样流进行预调度,并利用它们的大小来估计该 coflow 的平均流大小。然后采用最短 Coflow 优先策略,其中最短的概念是通过学习到的 coflow 大小和 coflow 竞争来确定的。我们表明,基于采样的学习对流大小倾斜具有鲁棒性,并且由于减少了协调器与本地代理之间的交互,具有大幅提高可扩展性的额外优势。我们使用 Azure 测试床和来自 Facebook 的公开生产集群追踪进行评估,结果表明,与现有技术 Aalo 相比,Philae 在 150 节点测试床上将平均 (P90) 情况下的 coflow 完成时间 (CCT) 降低了 1.50 倍 (8.00 倍),在 900 节点测试床上降低了 2.72 倍 (9.78 倍)。使用额外追踪的评估进一步证明了 Philae 对流大小倾斜的鲁棒性。

关键词

引用

@article{arxiv.2108.11255,
  title  = {A Case for Sampling Based Learning Techniques in Coflow Scheduling},
  author = {Akshay Jajoo and Y. Charlie Hu and Xiaojun Lin},
  journal= {arXiv preprint arXiv:2108.11255},
  year   = {2022}
}