Facebook 数据中心的深度学习训练:扩展性与扩展系统设计
分布式、并行与集群计算
2020-08-19 v3
摘要
大规模训练对于确保机器学习模型的高性能与高精度十分重要。在 Facebook,我们使用许多不同模型,包括计算机视觉、视频与语言模型。然而,本文聚焦于深度学习推荐模型(DLRM),其占我们数据中心训练需求的 50% 以上。推荐模型在训练中带来独特挑战,因为它们不仅消耗计算资源,还消耗内存容量以及内存与网络带宽。随着模型规模与复杂度增加,高效扩展训练成为挑战。为此我们设计了 Zion——Facebook 的下一代大内存训练平台,由 CPU 与加速器共同构成。同时,我们讨论了未来扩展式训练系统的设计需求。
引用
@article{arxiv.2003.09518,
title = {Deep Learning Training in Facebook Data Centers: Design of Scale-up and Scale-out Systems},
author = {Maxim Naumov and John Kim and Dheevatsa Mudigere and Srinivas Sridharan and Xiaodong Wang and Whitney Zhao and Serhat Yilmaz and Changkyu Kim and Hector Yuen and Mustafa Ozdal and Krishnakumar Nair and Isabel Gao and Bor-Yiing Su and Jiyan Yang and Mikhail Smelyanskiy},
journal= {arXiv preprint arXiv:2003.09518},
year = {2020}
}
备注
10 pages, 14 figures; adjusted Fig. 10, added reference; fixed typos