在最小缩放图像的小数据集上预训练轻量级视觉Transformer
计算机视觉与模式识别
2024-02-07 v1 机器学习
摘要
轻量级Vision Transformer(ViT)能否在小数据集和小图像分辨率下达到或超过卷积神经网络(如ResNet)的性能?本报告证明,通过预训练,使用最小图像缩放的掩码自编码器技术,纯ViT确实可以实现优越的性能。我们在CIFAR-10和CIFAR-100数据集上的实验涉及参数少于365万、乘累加(MAC)计数低于0.27G的ViT模型,符合“轻量级”模型的条件。与之前的方法不同,我们的方法在类似的轻量级基于Transformer的架构中达到了最先进的性能,而无需显著放大CIFAR-10和CIFAR-100的图像。这一成就凸显了我们模型的效率,不仅在于处理小数据集,还在于有效处理接近原始尺度的图像。
引用
@article{arxiv.2402.03752,
title = {Pre-training of Lightweight Vision Transformers on Small Datasets with Minimally Scaled Images},
author = {Jen Hong Tan},
journal= {arXiv preprint arXiv:2402.03752},
year = {2024}
}
备注
7 pages, 6 figures