MSCViT:面向小数据集的多尺度自注意力小型ViT架构
计算机视觉与模式识别
2025-01-15 v2
摘要
视觉Transformer(ViT)因其强大的长距离依赖建模能力在各种视觉任务中展现出巨大潜力。然而,这种成功很大程度上依赖于大规模样本的训练。在实际应用中,大规模数据集并不总是可用,而ViT在仅在小规模数据集(称为小数据集)上训练时表现不如卷积神经网络(CNN),因为它需要大量训练数据来确保其表示能力。本文提出了一种具有多尺度自注意力机制和卷积块的小型ViT架构(称为MSCViT),以在每一层建模不同尺度的注意力。首先,我们引入了小波卷积,它选择性地将频域分解得到的高频分量与我们的卷积通道结合以提取局部特征。然后,开发了一个轻量级多头注意力模块以减少令牌数量和计算成本。最后,骨干网络中的位置编码(PE)被局部特征提取模块取代。与原始ViT相比,它参数高效,特别适用于小数据集。在小数据集上进行了大量实验,我们的模型在CIFAR-100上达到了84.68%的准确率,参数为14.0M,计算量为2.5 GFLOPs,无需在大数据集上预训练。
引用
@article{arxiv.2501.06040,
title = {MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets},
author = {Bowei Zhang and Yi Zhang},
journal= {arXiv preprint arXiv:2501.06040},
year = {2025}
}