面向可解释深度局部学习的连续梯度协调方法
机器学习
2024-06-11 v1 神经与进化计算
摘要
减轻神经网络训练对全局反向传播(BP)的依赖已成为一个显著的研究课题,因为BP存在生物学上的不合理性和巨大的内存消耗。在现有解决方案中,局部学习使用局部误差训练神经网络的梯度隔离模块,并且已被证明即使在大规模数据集上也是有效的。然而,局部误差之间的协调从未被研究过。在本文中,我们首先从理论上研究了非贪婪的逐层训练,并表明当模块中相对于其输入的局部梯度与前一模块中相对于其输出的局部梯度不协调时,无法保证收敛。受理论结果的启发,我们进一步提出了一种局部训练策略,该策略连续正则化相邻模块之间的梯度协调,而不破坏梯度隔离或引入任何可学习参数。我们的方法可以集成到局部BP和无BP设置中。在实验中,与先前方法相比,我们取得了显著的性能提升。特别是,我们在ImageNet上针对CNN和Transformer架构的方法能够达到与全局BP竞争的性能,同时节省超过40%的内存消耗。
引用
@article{arxiv.2406.05222,
title = {Towards Interpretable Deep Local Learning with Successive Gradient Reconciliation},
author = {Yibo Yang and Xiaojie Li and Motasem Alfarra and Hasan Hammoud and Adel Bibi and Philip Torr and Bernard Ghanem},
journal= {arXiv preprint arXiv:2406.05222},
year = {2024}
}
备注
ICML 2024