数据矮人:全面理解大数据与 AI 工作负载的视角
分布式、并行与集群计算
2018-05-07 v2 性能
摘要
大数据与 AI 工作负载的复杂性和多样性使得理解它们变得困难且具挑战性。本文提出一种刻画大数据与 AI 工作负载的新方法。我们将每个大数据与 AI 工作负载视为在不同初始或中间数据输入上执行的一类或多类计算单元构成的流水线。每一类计算单元捕捉共性需求,同时合理脱离具体实现,因此我们称之为数据矮人。我们首次在种类广泛的大数据与 AI 工作负载中识别出占据大部分运行时间的八个数据矮人,包括 Matrix、Sampling、Logic、Transform、Set、Graph、Sort 和 Statistic。我们在不同软件栈上实现这八个数据矮人,作为开源大数据与 AI 基准测试套件的微基准,并从数据大小、类型、来源和模式的角度对这些数据矮人进行全面刻画,以此作为全面理解大数据与 AI 工作负载的视角。
引用
@article{arxiv.1802.00699,
title = {Data Dwarfs: A Lens Towards Fully Understanding Big Data and AI Workloads},
author = {Wanling Gao and Jianfeng Zhan and Lei Wang and Chunjie Luo and Daoyi Zheng and Fei Tang and Biwei Xie and Chen Zheng and Qiang Yang},
journal= {arXiv preprint arXiv:1802.00699},
year = {2018}
}
备注
19 pages, 16 figures and 2 tables