中文

基于极小化运动格式的神经网络模块化训练

机器学习 2023-10-06 v3

摘要

神经网络的贪婪逐层或模块化训练在内存受限的受限设备与端侧场景中颇具吸引力,因为它规避了端到端反向传播的若干难题。然而,它存在停滞问题:早期层过拟合,且当深度超过一定值后更深层不再提升测试精度。我们提出通过引入受分布空间中梯度流的极小化运动格式启发的模块化正则化来解决此问题。我们将该方法称为用于传输正则化贪婪学习的 TRGL,并从理论上加以研究,证明其导出的贪婪模块是正则的且逐步求解任务。在实验上,我们展示了在加入我们的正则化后,ResNets、Transformers 与 VGG 等多种架构的模块化训练精度得到提升,优于其他模块化训练方法且常优于端到端训练,同时内存占用减少多达 60%。

关键词

引用

@article{arxiv.2309.17357,
  title  = {Module-wise Training of Neural Networks via the Minimizing Movement Scheme},
  author = {Skander Karkar and Ibrahim Ayed and Emmanuel de Bézenac and Patrick Gallinari},
  journal= {arXiv preprint arXiv:2309.17357},
  year   = {2023}
}

备注

NeurIPS 2023. arXiv admin note: text overlap with arXiv:2210.00949