互锁反向传播:改进深度方向上的模型并行
机器学习
2022-07-11 v3 人工智能
摘要
近年来,最先进神经网络中的参数数量急剧增加。对大规模神经网络的这一关注热潮推动了使此类模型成为可能的新分布式训练策略的发展。其中一种策略是模型并行分布式训练。遗憾的是,模型并行可能存在资源利用率低下的问题,从而导致资源浪费。在这项工作中,我们改进了理想化模型并行优化设定——局部学习——中的近期进展。受全局设定中资源利用率低下以及局部设定中任务性能不佳的启发,我们引入了一类介于局部与全局学习之间的中间策略,称为互锁反向传播(interlocking backpropagation)。这些策略保留了局部优化诸多的计算效率优势,同时恢复了全局优化所实现的诸多任务性能。我们在图像分类 ResNet 与 Transformer 语言模型上评估了我们的策略,发现我们的策略在任务性能上始终优于局部学习,在训练效率上优于全局学习。
引用
@article{arxiv.2010.04116,
title = {Interlocking Backpropagation: Improving depthwise model-parallelism},
author = {Aidan N. Gomez and Oscar Key and Kuba Perlin and Stephen Gou and Nick Frosst and Jeff Dean and Yarin Gal},
journal= {arXiv preprint arXiv:2010.04116},
year = {2022}
}