基于独立子网络训练的深层神经网络分布式学习
机器学习
2022-04-20 v7 机器学习
摘要
分布式机器学习(ML)相比单机学习可动用更多计算资源,从而缩短训练时间。分布式学习将模型和数据划分到多台机器上,使模型和数据集规模可超越单机可用的算力和内存。然而在实践中,当分布式是必须的而非由使用者选择时,分布式 ML 颇具挑战。此类场景下,由于单 worker 内存容量有限甚至出于数据隐私问题,数据不可避免地分散于各 worker 之间。现有分布式方法会因 worker 间主导性的传输开销而彻底失效,或根本不适用。我们提出一种名为独立子网络训练(IST)的分布式全连接神经网络学习新方法以应对这些情况。在 IST 中,原始网络被分解为一组等深窄子网络,这些子网络先在本地训练,随后交换参数以生成新子网并重复训练周期。这种天然的“模型并行”方法通过仅在每台设备上存储部分网络参数来限制内存使用。此外,worker 间无共享数据要求(即子网训练是本地且独立的),且通过将原始网络分解为独立子网降低了通信量和频率。IST 的这些特性可应对分布式数据、互连缓慢或设备内存受限带来的问题,使其成为强制分布式情形的适用方法。实验表明,IST 的训练时间远低于常见分布式学习方法。
引用
@article{arxiv.1910.02120,
title = {Distributed Learning of Deep Neural Networks using Independent Subnet Training},
author = {Binhang Yuan and Cameron R. Wolfe and Chen Dun and Yuxin Tang and Anastasios Kyrillidis and Christopher M. Jermaine},
journal= {arXiv preprint arXiv:1910.02120},
year = {2022}
}