中文

在Google TPU-v3 Pods上扩展MLPerf-0.6模型

机器学习 2019-10-04 v3 人工智能 性能

摘要

近期Google TPU-v3 Pods向业界广泛的MLPerf v0.6训练基准的提交展示了一套行业相关ML模型的可扩展性。MLPerf定义了一套模型、数据集和基准测试时需遵循的规则,以确保结果在硬件、框架和公司之间具有可比性。使用这套模型,我们讨论了包括优化器选择、空间划分和权重更新分片在内的扩展到1024个TPU芯片所需的优化和技术。此外,我们识别出使模型扩展具有挑战性的模型特性,例如有限的数据并行性和未缩放权重。这些优化有助于在Google MLPerf-0.6提交中取得transformer、Resnet-50和SSD的创纪录性能。

关键词

引用

@article{arxiv.1909.09756,
  title  = {Scale MLPerf-0.6 models on Google TPU-v3 Pods},
  author = {Sameer Kumar and Victor Bitorff and Dehao Chen and Chiachen Chou and Blake Hechtman and HyoukJoong Lee and Naveen Kumar and Peter Mattson and Shibo Wang and Tao Wang and Yuanzhong Xu and Zongwei Zhou},
  journal= {arXiv preprint arXiv:1909.09756},
  year   = {2019}
}