基于数据主题的大数据与 AI 工作负载代理基准测试
分布式、并行与集群计算
2018-10-23 v1 性能
摘要
对于体系结构社区而言,除性能数据准确性外,合理的仿真时间也是一项硬性要求。然而,新兴的大数据与 AI 工作负载在二进制规模层面过于庞大,且在周期精确模拟器上运行成本高得令人望而却步。数据主题这一概念——被确定为一类对初始或中间数据执行的计算单元——是构建代理基准以模拟真实世界大数据与 AI 工作负载的第一步。然而,目前尚无实用方法基于数据主题构建代理基准以助力基于仿真的研究。本文中,我们着手研究以弥合数据主题与实用代理基准之间的鸿沟。我们提出一种基于机器学习方法的数据主题代理基准生成方法论,其将不同权重的数据主题组合以模拟大数据与 AI 工作负载。此外,我们使用轻量级栈实现多种数据主题,并将该方法论应用于五个真实工作负载以构建一套代理基准,同时考虑数据类型、模式与分布。评估结果表明,我们的代理基准在真实系统上将上述执行时间缩短 100 余倍,同时保持平均系统与微体系结构性能数据准确率高于 90%,即便更换输入数据集或集群配置亦然。而且,所生成的代理基准在不同体系结构上反映出一致的性能趋势。为便利社区,我们将在项目主页 http://prof.ict.ac.cn/BigDataBench 发布代理基准。
引用
@article{arxiv.1810.09376,
title = {Data Motif-based Proxy Benchmarks for Big Data and AI Workloads},
author = {Wanling Gao and Jianfeng Zhan and Lei Wang and Chunjie Luo and Zhen Jia and Daoyi Zheng and Chen Zheng and Xiwen He and Hainan Ye and Haibin Wang and Rui Ren},
journal= {arXiv preprint arXiv:1810.09376},
year = {2018}
}
备注
The paper will be published on 2018 IEEE International Symposium on Workload Characterization (IISWC 2018). arXiv admin note: text overlap with arXiv:1802.00699, arXiv:1711.03229