类MapReduce集群中多作业推测执行的优化
分布式、并行与集群计算
2015-01-06 v3
摘要
如今,典型数据中心中的计算集群可以轻松包含数十万台商用服务器,使得组件/机器故障成为常态而非例外。只要一个并行处理作业的众多任务中有一个被分配到故障机器上,该作业就可能被严重延迟。为了解决这个所谓的掉队者问题,大多数并行处理框架(如MapReduce)采用了多种策略,系统可以在任务进度异常缓慢或仅仅因为存在额外空闲资源时,推测性地启动同一任务的额外副本。本文重点研究不同负载条件下并行处理集群的推测执行方案设计。对于轻负载情况,我们分析并提出了两种基于优化的方案:智能克隆算法(SCA),基于最大化作业效用;以及掉队者检测算法(SDA),最小化作业的整体资源消耗。我们还推导了应使用SCA或SDA进行推测执行的工作负载阈值。仿真结果表明,与Microsoft Mantri的推测执行策略相比,SCA和SDA均可将作业流时间减少近60%。对于重负载情况,我们提出了增强型推测执行(ESE)算法,它是Microsoft Mantri方案的扩展。我们表明,在消耗相同资源的情况下,ESE算法在作业流时间方面可比Mantri基线方案提升18%。
引用
@article{arxiv.1406.0609,
title = {Optimization for Speculative Execution of Multiple Jobs in a MapReduce-like Cluster},
author = {Huanle Xu and Wing Cheong Lau},
journal= {arXiv preprint arXiv:1406.0609},
year = {2015}
}
备注
This paper has been withdrawn due to the simulation part need to be strengthened