中文

ATLAS:一种面向Hadoop的自适应故障感知调度器

分布式、并行与集群计算 2016-11-04 v2

摘要

Hadoop已成为当今云环境中处理大数据的事实标准。Hadoop在云中的性能对许多重要应用有直接影响,从网络分析、网络索引、图像与文档处理到高性能科学计算。然而,由于云的规模化、复杂性和动态性,故障十分常见,且这些故障常影响Hadoop中运行的作业性能。尽管Hadoop具备内置的故障检测与恢复机制,仍有若干调度作业因云环境中不可预见的事件而失败。单个任务失败可导致整个作业失败以及作业运行时间不可预测。在本报告中,我们提出ATLAS (AdapTive faiLure-Aware Scheduler),一种可将其调度决策适应云环境中发生事件的新Hadoop调度器。利用统计模型,ATLAS预测任务失败并即时调整其调度决策以减少任务失败发生。我们在Amazon Elastic MapReduce (EMR)的Hadoop框架中实现ATLAS,并进行案例研究将其性能与FIFO、Fair和Capacity调度器比较。结果表明ATLAS可将失败作业百分比降低至多28%,失败任务百分比降低至多39%,作业总执行时间平均减少10分钟。ATLAS还降低了CPU与内存使用率。

关键词

引用

@article{arxiv.1511.01446,
  title  = {ATLAS: An Adaptive Failure-aware Scheduler for Hadoop},
  author = {Mbarka Soualhia and Foutse Khomh and Sofiene Tahar},
  journal= {arXiv preprint arXiv:1511.01446},
  year   = {2016}
}

备注

24 pages