中文

CNN的解耦贪心学习

机器学习 2020-06-23 v4 机器学习

摘要

通过反向传播训练神经网络的一个常被提及的低效问题是更新锁定问题:每一层必须等待信号传播过整个网络后才能更新。已有若干可缓解此问题的替代方案被提出。在此背景下,我们考虑一种更简单却更有效的替代方法,其使用最小反馈,我们称之为解耦贪心学习(DGL)。它基于联合训练目标的贪心松弛,近期已证明在大规模图像分类的卷积神经网络(CNNs)中有效。我们考虑该目标的一种优化,使我们能够解耦层的训练,允许网络中的层或模块以层数为潜在线性并行化进行训练。借助重放缓冲区,我们展示该方法可扩展至异步设定,其中模块可在可能有较大通信延迟的情况下运行。我们从理论和经验上证明该方法收敛。进而,我们通过经验发现其可比顺序贪心优化获得更好的泛化能力。我们在 CIFAR-10 数据集和大规模 ImageNet 数据集上展示了 DGL 相对于替代方法的有效性。

关键词

引用

@article{arxiv.1901.08164,
  title  = {Decoupled Greedy Learning of CNNs},
  author = {Eugene Belilovsky and Michael Eickenberg and Edouard Oyallon},
  journal= {arXiv preprint arXiv:1901.08164},
  year   = {2020}
}