面向小数据集的视觉Transformer中深度卷积的高效训练
计算机视觉与模式识别
2025-01-17 v4
摘要
视觉Transformer(ViT)利用Transformer编码器通过将图像划分为补丁来捕获全局信息,在 various computer vision tasks 中取得优异性能。然而,ViT的自注意力机制从一开始就捕获全局上下文,忽略了图像或视频中相邻像素之间的内在关系。Transformer主要关注全局信息,忽略细粒度的局部细节。因此,ViT在图像或视频数据集训练时缺乏归纳偏置。相比之下,卷积神经网络(CNN)由于依赖局部滤波器,具有内在的归纳偏置,在数据较少时更高效,收敛更快。本文提出了一种轻量级深度卷积模块作为ViT模型的快捷方式,绕过整个Transformer模块,以最小的开销确保模型同时捕获局部和全局信息。此外,我们引入两个架构变体,允许深度卷积模块应用于多个Transformer模块以节省参数,并 incorporating independent parallel Depth-Wise Convolution 模块,采用不同卷积核以增强局部信息的获取。所提出的方法在图像分类、目标检测和实例分割任务上显著提升了ViT模型性能,尤其是在小数据集上效果更为突出。我们在CIFAR-10、CIFAR-100、Tiny-ImageNet和ImageNet进行图像分类评估,在COCO进行目标检测和实例分割评估。源代码可在 https://github.com/ZTX-100/Efficient_ViT_with_DW 查阅。
引用
@article{arxiv.2407.19394,
title = {Depth-Wise Convolutions in Vision Transformers for Efficient Training on Small Datasets},
author = {Tianxiao Zhang and Wenju Xu and Bo Luo and Guanghui Wang},
journal= {arXiv preprint arXiv:2407.19394},
year = {2025}
}