中文

SODA:一种基于混合程序分析、面向数据密集型应用的语义感知优化框架

分布式、并行与集群计算 2021-07-27 v1

摘要

在数据爆炸时代,越来越多如 Apache Hadoop 和 Spark 的数据密集型计算框架被提出,以并行处理海量非结构化数据。由于这些框架提供的编程模型允许用户使用预定义操作指定复杂且多样化的用户自定义函数(UDF),若程序员未能充分理解代码、数据与运行时系统的语义,则调优整体系统性能成为一大挑战。本文设计了一种用于数据密集型应用的整体语义感知优化框架,即基于混合程序分析的 SODA,以协助程序员调优性能问题。SODA 是一个两阶段框架:离线阶段为静态分析,分析先前执行的在线阶段的代码与性能剖析数据,生成参数化且插桩的应用;在线阶段为动态分析,持续跟踪应用执行并收集数据与系统的运行时信息。在四个真实 Spark 应用上的大量实验结果表明,借助所提出的三种优化策略——即缓存管理、操作重排序与元素剪枝,SODA 相比原始实现分别可获得最高 60%、10%、8% 的加速。

关键词

引用

@article{arxiv.2107.11536,
  title  = {SODA: A Semantics-Aware Optimization Framework for Data-Intensive Applications Using Hybrid Program Analysis},
  author = {Bingbing Rao and Zixia Liu and Hong Zhang and Siyang Lu and Liqiang Wang},
  journal= {arXiv preprint arXiv:2107.11536},
  year   = {2021}
}

备注

2021 IEEE International Conference on Cloud Computing