中文

MLPerf 推理基准测试

机器学习 2020-05-12 v2 性能 机器学习

摘要

机器学习(ML)硬件和软件系统的需求正在迅速增长。在 ML 应用的驱动下,不同 ML 推理系统的数量呈爆发式增长。超过 100 家组织正在构建 ML 推理芯片,而采用现有模型的系统其功耗跨度至少三个数量级、性能跨度至少五个数量级;它们从嵌入式设备到数据中心解决方案均有涵盖。支撑硬件的是十几个或更多的软件框架与库。ML 硬件与 ML 软件的无数组合,使得以架构中立、具代表性且可复现的方式评估 ML 系统性能变得困难。业界显然需要行业标准的 ML 基准测试与评估准则。MLPerf Inference 回应了这一需求。在本文中,我们提出用于评估 ML 推理系统的基准测试方法。在超过 30 家组织以及 200 多名 ML 工程师与从业者的推动下,MLPerf 规定了一套规则与最佳实践,以确保在架构迥异的系统间具有可比性。首次征集提交便从 14 家组织获得了超过 600 项可复现的推理性能测量,代表了展现广泛能力的 30 多个系统。这些提交证明了该基准的灵活性与适应性。

关键词

引用

@article{arxiv.1911.02549,
  title  = {MLPerf Inference Benchmark},
  author = {Vijay Janapa Reddi and Christine Cheng and David Kanter and Peter Mattson and Guenther Schmuelling and Carole-Jean Wu and Brian Anderson and Maximilien Breughe and Mark Charlebois and William Chou and Ramesh Chukka and Cody Coleman and Sam Davis and Pan Deng and Greg Diamos and Jared Duke and Dave Fick and J. Scott Gardner and Itay Hubara and Sachin Idgunji and Thomas B. Jablin and Jeff Jiao and Tom St. John and Pankaj Kanwar and David Lee and Jeffery Liao and Anton Lokhmotov and Francisco Massa and Peng Meng and Paulius Micikevicius and Colin Osborne and Gennady Pekhimenko and Arun Tejusve Raghunath Rajan and Dilip Sequeira and Ashish Sirasao and Fei Sun and Hanlin Tang and Michael Thomson and Frank Wei and Ephrem Wu and Lingjie Xu and Koichi Yamada and Bing Yu and George Yuan and Aaron Zhong and Peizhao Zhang and Yuchen Zhou},
  journal= {arXiv preprint arXiv:1911.02549},
  year   = {2020}
}

备注

ISCA 2020