用于同步与异步分布式学习的 CNN 解耦贪婪学习
机器学习
2021-06-14 v1 分布式、并行与集群计算
摘要
使用反向传播训练神经网络的一个常被提及的低效问题是更新锁定问题:每一层必须等待信号传播过整个网络后才能更新。已有若干可缓解此问题的替代方案被提出。在此背景下,我们考虑一种基于最小反馈的简单替代方法,称之为解耦贪婪学习(DGL, Decoupled Greedy Learning)。它基于经典的联合训练目标的贪婪松弛,最近被证明在大规模图像分类的卷积神经网络(CNNs)中是有效的。我们考虑该目标的一种优化,使得我们能够解耦层的训练,允许网络中的层或模块以潜在的线性并行化进行训练。利用回放缓冲区,我们表明该方法可扩展到异步设置,其中模块可以在可能存在较大通信延迟的情况下运行并继续更新。为解决带宽与内存问题,我们提出了一种基于在线向量量化的方法。这可大幅降低模块间的通信带宽以及回放缓冲区所需的内存。我们从理论和经验上证明了该方法的收敛性,并将其与顺序求解器进行比较。我们在 CIFAR-10 数据集和大规模 ImageNet 数据集上展示了 DGL 相对于其他替代方法的有效性。
引用
@article{arxiv.2106.06401,
title = {Decoupled Greedy Learning of CNNs for Synchronous and Asynchronous Distributed Learning},
author = {Eugene Belilovsky and Louis Leconte and Lucas Caccia and Michael Eickenberg and Edouard Oyallon},
journal= {arXiv preprint arXiv:2106.06401},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:1901.08164