中文

ResIST:用于分布式训练的ResNet分层分解方法

机器学习 2022-03-15 v2 计算机视觉与模式识别 分布式、并行与集群计算 最优化与控制

摘要

我们提出ResIST,一种用于残差网络(ResNets)的新型分布式训练协议。ResIST将全局ResNet随机分解为若干浅层子ResNet,这些子网络以分布式方式独立训练若干本地迭代,之后将其更新同步并聚合到全局模型中。在下一轮中,重新随机生成子ResNet,该过程重复直至收敛。从构造上看,每次迭代中,ResIST仅向每台机器通信一小部分网络参数,且在训练过程中从不使用完整模型。因此,ResIST将ResNet训练每迭代的通信、内存和时间需求降低到全模型训练需求的一小部分。与数据并行训练及带本地SGD的数据并行训练等常见协议相比,ResIST在保持模型性能竞争力的同时,降低了通信与计算需求。

关键词

引用

@article{arxiv.2107.00961,
  title  = {ResIST: Layer-Wise Decomposition of ResNets for Distributed Training},
  author = {Chen Dun and Cameron R. Wolfe and Christopher M. Jermaine and Anastasios Kyrillidis},
  journal= {arXiv preprint arXiv:2107.00961},
  year   = {2022}
}

备注

26 pages, 8 figures, pre-print under review