FireCaffe:计算集群上深度神经网络训练的近线性加速
计算机视觉与模式识别
2016-01-11 v2
摘要
高精度深度神经网络(DNNs)的漫长训练时间阻碍了新 DNN 架构的研究,并减缓了高精度 DNN 的开发。本文中我们提出 FireCaffe,它成功地在 GPU 集群上扩展了深度神经网络训练。我们还提出若干最佳实践,以帮助比较扩展和加速深度神经网络训练方法的进展。分布式算法的速度和可扩展性几乎总受限于服务器间通信的开销;DNN 训练也不例外。因此,这里的关键考量是在不降低所训练 DNN 模型精度的前提下,尽可能减少通信开销。我们的方法有三个关键支柱。首先,我们选用能在 GPU 服务器间实现高带宽的网络硬件——Infiniband 或 Cray 互连为此理想选择。其次,我们考虑了多种通信算法,发现归约树比传统的参数服务器方法更高效且可扩展。第三,我们可选择增大批量大小以减少 DNN 训练期间通信总量,并确定了能在以大批量训练时复现小批量精度的超参数。在 ImageNet 上训练 GoogLeNet 和 Network-in-Network 时,我们在 128 个 GPU 的集群上分别实现了 47 倍和 39 倍的加速。
引用
@article{arxiv.1511.00175,
title = {FireCaffe: near-linear acceleration of deep neural network training on compute clusters},
author = {Forrest N. Iandola and Khalid Ashraf and Matthew W. Moskewicz and Kurt Keutzer},
journal= {arXiv preprint arXiv:1511.00175},
year = {2016}
}
备注
Version 2: Added results on 128 GPUs