面向监督式局部学习的动量辅助网络
计算机视觉与模式识别
2024-08-13 v4
摘要
深度神经网络通常采用端到端反向传播进行训练,这缺乏生物学的可信度,并在网络参数更新时引发锁定困境,导致显著的 GPU 内存占用。监督式局部学习将网络分割为多个局部块,由独立的辅助网络更新。然而,这些方法无法取代端到端训练,因梯度仅在局部块内部传播,导致块之间缺乏信息交换。为解决此问题并建立跨块的信息传输机制,我们提出动量辅助网络(MAN),其建立动态交互机制。MAN 利用相邻局部块参数的指数移动平均(EMA)来增强信息流。通过 EMA 更新的该辅助网络有助于填补块之间信息差的鸿沟。然而,我们观察到直接应用 EMA 参数存在局限性,由于局部块之间的特征差异。为克服这一问题,我们引入可学习的偏置项,以进一步提升性能。我们在四个图像分类数据集(CIFAR-10、STL-10、SVHN、ImageNet)上进行验证,实现了卓越的性能和显著的内存节省。值得注意的是,与端到端训练相比,我们的方法可在 ImageNet 数据集上将 GPU 内存使用降低超过 45%,同时实现更高的性能。动量辅助网络为监督式局部学习提供了新的视角。我们的代码已公开:https://github.com/JunhaoSu0/MAN
引用
@article{arxiv.2407.05623,
title = {Momentum Auxiliary Network for Supervised Local Learning},
author = {Junhao Su and Changpeng Cai and Feiyu Zhu and Chenghao He and Xiaojie Xu and Dongzhi Guan and Chenyang Si},
journal= {arXiv preprint arXiv:2407.05623},
year = {2024}
}
备注
Accepted by ECCV2024(Oral)