中文

通过 Hive 和 Pig 探索大规模云的非同质性与动态性

分布式、并行与集群计算 2015-03-24 v1

摘要

云计算在各个层面都涉及异质性和动态性,因此需要在此类环境中管理资源并进行合理分配。资源规划与调度需要正确理解到达模式和资源调度。对工作负载的研究有助于更好地理解其相关环境。Google 于 2014 年 11 月发布了最新版本的集群追踪数据 trace version 2.1。该追踪数据包含约 29 天内跨越 70 万个作业的单元格信息。本文对该集群追踪数据进行了统计分析。由于追踪数据规模巨大,我们使用了 Hive,这是一个基于 Hadoop 分布式文件系统 (HDFS) 的大数据查询与分析平台。通过 Beeswax 接口访问 Hive。数据通过 HCatalog 导入 HDFS。除了 Hive,还使用了 Pig,这是一种脚本语言,在 Hadoop 之上提供抽象。据我们所知,我们采用的分析方法是新颖的,并帮助获得了若干有用的见解。本文使用 K-means++ 聚类对作业和到达时间进行了聚类,随后分析了作业到达时间的分布,揭示其符合 Weibull 分布,而资源使用情况接近 Zipf 类分布,进程运行时间则呈现重尾分布。

关键词

引用

@article{arxiv.1503.06600,
  title  = {Exploring Non-Homogeneity and Dynamicity of High Scale Cloud through Hive and Pig},
  author = {Kashish Ara Shakil and Mansaf Alam and Shuchi Sethi},
  journal= {arXiv preprint arXiv:1503.06600},
  year   = {2015}
}