PowerAI DDL
分布式、并行与集群计算
2017-08-08 v1 人工智能
机器学习
摘要
随着深度神经网络变得越来越复杂且输入数据集日益庞大,将深度神经网络训练至预期精度可能需要数天甚至数周时间。因此,大规模的分布式深度学习是一项关键能力,因为它有望将训练时间从数周缩短至数小时。在本文中,我们提出了一种软硬件协同优化的分布式深度学习系统,该系统可实现高达数百个 GPU 的近线性扩展。其核心算法是一种多环通信模式,在延迟与带宽之间提供了良好的折衷,并能适应多种系统配置。该通信算法以库的形式实现以便于使用。该库已被集成至 Tensorflow、Caffe 和 Torch 中。我们使用 64 台 IBM Power8 S822LC 服务器(256 个 GPU),在约 7 小时内将 Resnet-101 在 Imagenet 22K 上训练至 33.8% 的验证精度。微软的 ADAM 和谷歌的 DistBelief 结果在 Imagenet 22K 上均未达到 30% 的验证精度。与 Facebook AI Research 最近关于 256 GPU 训练的论文相比,我们使用了不同的通信算法,且我们结合软硬件的系统为 Resnet-50 提供了更优的通信开销。启用 PowerAI DDL 的 Torch 版本使用 64 台 IBM Power8 S822LC 服务器(256 个 GPU),在 50 分钟内完成了 Resnet 50 针对 1K 类别的 90 个 epoch 的训练。
引用
@article{arxiv.1708.02188,
title = {PowerAI DDL},
author = {Minsik Cho and Ulrich Finkler and Sameer Kumar and David Kung and Vaibhav Saxena and Dheeraj Sreedhar},
journal= {arXiv preprint arXiv:1708.02188},
year = {2017}
}