ATLAS:一种面向Hadoop的自适应故障感知调度器
分布式、并行与集群计算
2016-11-04 v2
摘要
Hadoop已成为当今云环境中处理大数据的事实标准。Hadoop在云中的性能对许多重要应用有直接影响,从网络分析、网络索引、图像与文档处理到高性能科学计算。然而,由于云的规模化、复杂性和动态性,故障十分常见,且这些故障常影响Hadoop中运行的作业性能。尽管Hadoop具备内置的故障检测与恢复机制,仍有若干调度作业因云环境中不可预见的事件而失败。单个任务失败可导致整个作业失败以及作业运行时间不可预测。在本报告中,我们提出ATLAS (AdapTive faiLure-Aware Scheduler),一种可将其调度决策适应云环境中发生事件的新Hadoop调度器。利用统计模型,ATLAS预测任务失败并即时调整其调度决策以减少任务失败发生。我们在Amazon Elastic MapReduce (EMR)的Hadoop框架中实现ATLAS,并进行案例研究将其性能与FIFO、Fair和Capacity调度器比较。结果表明ATLAS可将失败作业百分比降低至多28%,失败任务百分比降低至多39%,作业总执行时间平均减少10分钟。ATLAS还降低了CPU与内存使用率。
引用
@article{arxiv.1511.01446,
title = {ATLAS: An Adaptive Failure-aware Scheduler for Hadoop},
author = {Mbarka Soualhia and Foutse Khomh and Sofiene Tahar},
journal= {arXiv preprint arXiv:1511.01446},
year = {2016}
}
备注
24 pages