识别大数据分析中的矮人工作负载
数据库
2015-05-27 v1
摘要
大数据基准测试尤为重要,并为评估蓬勃发展的大数据系统提供了适用的标尺。然而,大数据计算的广泛覆盖和巨大复杂性给大数据基准测试带来了巨大挑战。我们如何能够使用最小的计算单元集来构建基准套件,以代表大数据分析工作负载的多样性?大数据矮人是对大数据计算中频繁出现的操作进行提取的抽象。一个矮人代表一个计算单元,大数据工作负载被分解成一个或多个矮人。此外,相较于海量真实工作负载,矮人工作负载在评估大数据系统时更具成本效益和代表性。在本文中,我们广泛调研了六个最重要或新兴的应用领域,即搜索引擎、社交网络、电子商务、多媒体、生物信息学和天文学。在分析四十种代表性算法后,我们挑选出大数据分析中除OLAP外的八种矮人工作负载,即线性代数、采样、逻辑操作、变换操作、集合操作、图操作、统计操作和排序。
引用
@article{arxiv.1505.06872,
title = {Identifying Dwarfs Workloads in Big Data Analytics},
author = {Wanling Gao and Chunjie Luo and Jianfeng Zhan and Hainan Ye and Xiwen He and Lei Wang and Yuqing Zhu and Xinhui Tian},
journal= {arXiv preprint arXiv:1505.06872},
year = {2015}
}