中文

大数据工作负载的特征刻画与体系结构启示

分布式、并行与集群计算 2015-06-29 v1 数据库 性能

摘要

大数据领域在不断增加的工作负载和运行时系统方面正快速扩展,这种情况给工作负载特征刻画带来了严峻挑战,而后者是创新系统与体系结构设计的基础。先前在大数据基准测试方面的主要工作要么提出全面但大量的工作负载,要么仅根据所谓流行度选择少数工作负载,这可能导致片面甚至偏倚的观察。本文中,基于一个全面的大数据基准测试套件——BigDataBench,我们从微体系结构视角将77个工作负载精简为17个代表性工作负载。在一个典型的当前实践平台——Intel Xeon E5645上,我们将代表性大数据工作负载与SPECINT、SPECCFP、PARSEC、CloudSuite和HPCC进行比较。经过全面的工作负载特征刻画,我们得到以下观察。首先,大数据工作负载是以数据移动为主的计算,伴有更多分支操作,在指令组合中占比高达92%,这使其区别于桌面(SPEC CPU2006)、CMP(PARSEC)、HPC(HPCC)工作负载。其次,与先前工作一致,基于Hadoop和Spark的大数据工作负载具有更高的前端停顿。与传统工作负载即PARSEC相比,大数据工作负载具有更大的指令足迹。但我们也注意到,除了不同的指令级并行度外,不同大数据工作负载间的前端效率存在显著差异。第三,我们发现未能高效使用当前实践处理器的复杂软件栈是导致高前端停顿的主要因素之一。对于相同工作负载,不同软件栈的多种实现间L1I缓存缺失率存在一个数量级的差异。

关键词

引用

@article{arxiv.1506.07943,
  title  = {Characterization and Architectural Implications of Big Data Workloads},
  author = {Lei Wang and Jianfeng Zhan and Zhen Jia and Rui Han},
  journal= {arXiv preprint arXiv:1506.07943},
  year   = {2015}
}