面向小数据集上 Vision Transformers 的显式提升输入信息密度
计算机视觉与模式识别
2022-10-27 v1
摘要
自从 Vision Transformer (ViT) 在视觉任务中成功应用以来,Vision Transformers 近期引起了广泛关注。借助视觉 Transformer,特别是多头自注意力模块,网络能够固有地捕获长程依赖关系。然而,这些注意力模块通常需要在大数据集上进行训练,并且与广泛占主导地位的骨干网络(如 ResNet)相比,从头开始训练时视觉 Transformer 在小数据集上表现较差。需要注意的是,Transformer 模型最初是为自然语言处理提出的,其携带的信息比自然图像更密集。为了提升视觉 Transformer 在小数据集上的性能,本文提出在频域显式提升输入信息密度。具体而言,我们引入通过使用离散余弦变换(DCT)计算频域中的通道级热力图来选择通道的方法,在保留大部分信息的同时减小输入尺寸,从而提高信息密度。结果表明,与以往工作相比,在保留的通道减少 25% 的情况下取得了更好的性能。大量实验证明了所提出方法在五个小规模数据集上的有效性,包括 CIFAR-10/100、SVHN、Flowers-102 和 Tiny ImageNet。使用 Swin 和 Focal Transformers,准确率最高提升了 17.05%。代码可在 https://github.com/xiangyu8/DenseVT 获取。
引用
@article{arxiv.2210.14319,
title = {Explicitly Increasing Input Information Density for Vision Transformers on Small Datasets},
author = {Xiangyu Chen and Ying Qin and Wenju Xu and Andrés M. Bur and Cuncong Zhong and Guanghui Wang},
journal= {arXiv preprint arXiv:2210.14319},
year = {2022}
}
备注
Accepted to NeurIPS workshop (VTTA) 2022