中文

用于大数据框架中物化的基于代价的存储格式选择器

分布式、并行与集群计算 2018-06-12 v1

摘要

现代大数据框架(如 Hadoop 和 Spark)允许多个用户同时进行大规模分析。通常,用户为其分析任务部署数据密集型工作流。这些不同用户的 DIWs 共享许多公共部分(即 50-80%),这些部分可以被物化以便在未来的执行中重用。物化提高了 DIWs 的整体处理时间,并节省了计算资源。当前的物化解决方案通过使用固定的数据格式将数据存储在分布式文件系统 上。然而,固定的选择可能并非在所有情况下都是最优的。例如,众所周知,根据后续操作的访问模式,不同的数据分片策略(即水平、垂直或混合)表现更好或更差。在本文中,我们提出了一种基于代价的方法,帮助在每种情况下决定最合适的存储格式。我们提出了一个考虑三种分片策略的通用基于代价的存储格式选择器框架。然后,我们使用我们的框架为特定的 Hadoop 数据格式(即 SequenceFile、Avro 和 Parquet)实例化代价模型,并用实际用例对其进行测试。我们的解决方案平均比 SequenceFile 提速 33%,比 Avro 提速 11%,比 Parquet 提速 32%,总体而言,它提供了高达 25% 的性能提升。

关键词

引用

@article{arxiv.1806.03901,
  title  = {A Cost-based Storage Format Selector for Materialization in Big Data Frameworks},
  author = {Rana Faisal Munir and Alberto Abelló and Oscar Romero and Maik Thiele and Wolfgang Lehner},
  journal= {arXiv preprint arXiv:1806.03901},
  year   = {2018}
}