基于特征重建的Transformer局部学习
计算机视觉与模式识别
2023-01-02 v1
摘要
由于优于传统卷积神经网络(CNNs)的性能,Transformers正变得日益流行。然而,Transformers通常需要比CNNs大得多的内存来进行训练,这阻碍了它们在许多低资源场景中的应用。局部学习将网络划分为若干独立模块并分别训练,是端到端(E2E)训练方法之外一种有前景的替代方案,可减少训练内存占用并提升并行度。本文首次将局部学习应用于transformers以达到此目的。基于CNN的标准局部学习方法InfoPro [32]为CNN中每个模块重建输入图像。然而,重建整幅图像泛化性不佳。在本文中,我们为每个局部模块提出一种新机制,不再重建整幅图像,而是重建由先前模块生成的输入特征。我们在4个常用数据集与3种常用解码器结构上基于Swin-Tiny评估了我们的方法。实验表明,在CIFAR-10、CIFAR-100、STL-10和SVHN数据集上,我们的方法比我们引入的以Transformer为骨干的InfoPro(InfoPro-Transformer)最高高出0.58%,同时最多节省12%内存。与E2E方法相比,当网络划分为2个模块时我们所需GPU内存减少36%,划分为4个模块时减少45%。
引用
@article{arxiv.2212.14215,
title = {Local Learning on Transformers via Feature Reconstruction},
author = {Priyank Pathak and Jingwei Zhang and Dimitris Samaras},
journal= {arXiv preprint arXiv:2212.14215},
year = {2023}
}