BigDataBench:可扩展的统一大数据与 AI 基准测试套件
分布式、并行与集群计算
2018-11-26 v2 人工智能
性能
摘要
技术的若干根本性变化表明,领域专用软硬件协同设计是仅存的路径。在此背景下,体系结构、系统、数据管理与机器学习界更加关注创新的大数据与 AI 算法、体系结构和系统。遗憾的是,大数据与 AI 系统的复杂性、多样性、频繁变更的工作负载和快速演进带来了巨大挑战。首先,为每种可能工作负载创建新基准或代理的传统基准测试方法对于大数据与 AI 基准测试不可扩展,甚至不可能。其次,针对一个或多个应用甚至某应用领域的特性定制体系结构成本高昂。我们将每个大数据与 AI 工作负载视为对不同的初始或中间数据输入执行一类或多类计算单元构成的流水线,每类我们称之为数据模态。基于我们先前工作确定的占据广泛大数据与 AI 工作负载绝大部分运行时间的八种数据模态,我们提出一种可扩展的基准测试方法,使用一种或多种数据模态的组合来表征大数据与 AI 工作负载的多样性。遵循该方法,我们提出统一的大数据与 AI 基准测试套件——BigDataBench 4.0,可从~\url{http://prof.ict.ac.cn/BigDataBench} 公开获取。该统一基准套件为领域专用软硬件协同设计提供了新思路:使系统与体系结构适配统一的八种数据模态的特性,而非逐个针对一个或多个应用案例。此外,我们首次利用 BigDataBench 4.0 中七类工作负载类型的基准全面刻画了 CPU 流水线效率。
引用
@article{arxiv.1802.08254,
title = {BigDataBench: A Scalable and Unified Big Data and AI Benchmark Suite},
author = {Wanling Gao and Jianfeng Zhan and Lei Wang and Chunjie Luo and Daoyi Zheng and Xu Wen and Rui Ren and Chen Zheng and Xiwen He and Hainan Ye and Haoning Tang and Zheng Cao and Shujie Zhang and Jiahui Dai},
journal= {arXiv preprint arXiv:1802.08254},
year = {2018}
}
备注
15 pages, 12 figures