中文

在最小缩放图像的小数据集上预训练轻量级视觉Transformer

计算机视觉与模式识别 2024-02-07 v1 机器学习

摘要

轻量级Vision Transformer(ViT)能否在小数据集和小图像分辨率下达到或超过卷积神经网络(如ResNet)的性能?本报告证明,通过预训练,使用最小图像缩放的掩码自编码器技术,纯ViT确实可以实现优越的性能。我们在CIFAR-10和CIFAR-100数据集上的实验涉及参数少于365万、乘累加(MAC)计数低于0.27G的ViT模型,符合“轻量级”模型的条件。与之前的方法不同,我们的方法在类似的轻量级基于Transformer的架构中达到了最先进的性能,而无需显著放大CIFAR-10和CIFAR-100的图像。这一成就凸显了我们模型的效率,不仅在于处理小数据集,还在于有效处理接近原始尺度的图像。

关键词

引用

@article{arxiv.2402.03752,
  title  = {Pre-training of Lightweight Vision Transformers on Small Datasets with Minimally Scaled Images},
  author = {Jen Hong Tan},
  journal= {arXiv preprint arXiv:2402.03752},
  year   = {2024}
}

备注

7 pages, 6 figures