量化与提升基于云存储的分布式深度学习性能
分布式、并行与集群计算
2021-11-24 v1
摘要
云计算为分布式深度学习工作负载提供了强大且低成本的环境。然而,训练复杂的深度学习模型通常需要访问大量数据,这很容易超出本地磁盘的容量。先前的研究常忽略这一训练数据问题,隐含假设数据在本地可用或通过低延迟基于网络的存储可用。此类隐含假设在基于云的训练环境中往往不成立,因为深度学习实践者按需创建和销毁专用GPU集群,或没有本地存储的便利,例如在无服务器工作负载中。在这项工作中,我们研究了利用完全驻留在云存储桶中的训练数据的分布式训练性能。这些存储桶承诺低存储成本,但存在固有的带宽限制,使其看似不适合高效的训练方案。为应对这些带宽限制,我们提出使用缓存与预取两种经典技术来缓解训练性能下降。我们基于流行的深度学习框架PyTorch,通过其数据加载抽象构建了一个原型系统DELI。随后我们使用Google Cloud的NVIDIA K80 GPU服务器评估了两种深度学习工作负载的训练性能,结果表明与直接从存储桶加载相比,我们能将训练循环等待数据的时间减少85.6%–93.5%——从而实现了与直接从磁盘加载相当的性能——同时每次仅在本地存储一小部分数据。此外,DELI有潜力降低训练工作负载的运行成本,尤其是对每轮训练时间较长的模型。
引用
@article{arxiv.2108.06322,
title = {Quantifying and Improving Performance of Distributed Deep Learning with Cloud Storage},
author = {Nicholas Krichevsky and Renee St Louis and Tian Guo},
journal= {arXiv preprint arXiv:2108.06322},
year = {2021}
}
备注
To appear in IC2E 2021