中文

在CPU集群架构上优化深度学习推荐系统的训练

分布式、并行与集群计算 2020-05-12 v1 信息检索 机器学习 性能

摘要

在过去两年中,许多研究人员的目标是从HPC系统中为AI任务榨取最后一点性能。这一讨论常在如何快速训练ResNet50的背景下进行。遗憾的是,ResNet50在2020年已不再是代表性工作负载。因此,我们聚焦于占云计算中心大部分AI算力的推荐系统。更具体地,我们关注Facebook的DLRM基准。通过使其能在专为HPC定制的最新CPU硬件和软件上运行,我们相比参考CPU实现在单插槽上实现了超过两个数量级的性能提升(110倍),并在适配超大数据集的同时达到最高64插槽的高扩展效率。本文讨论了DLRM中各类算子的优化技术,以及这些不同算子对系统哪些组件造成压力。所呈现的技术适用于具有与DLRM相同扩展挑战/特征的一 broader 类DL工作负载。

关键词

引用

@article{arxiv.2005.04680,
  title  = {Optimizing Deep Learning Recommender Systems' Training On CPU Cluster Architectures},
  author = {Dhiraj Kalamkar and Evangelos Georganas and Sudarshan Srinivasan and Jianping Chen and Mikhail Shiryaev and Alexander Heinecke},
  journal= {arXiv preprint arXiv:2005.04680},
  year   = {2020}
}