CIFAR10上小型视觉Transformer的强大设计
机器学习
2025-01-14 v1 计算机视觉与模式识别
摘要
视觉Transformer(ViT)在大规模数据集上取得了显著成功,但在较小数据集上的性能往往不如卷积神经网络(CNN)。本文探讨了针对小数据集(以CIFAR-10为基准)的Tiny ViT的设计和优化。我们系统地评估了数据增强、补丁令牌初始化、低秩压缩和多类令牌策略对模型性能的影响。我们的实验表明,多头潜在注意力(MLA)中查询的低秩压缩仅造成最小的性能损失,表明ViT中存在冗余。此外,引入多个CLS令牌提高了全局表示能力,提升了准确率。这些发现为优化Tiny ViT提供了一个全面的框架,为高效有效的设计提供了实用见解。代码可在https://github.com/erow/PoorViTs获取。
引用
@article{arxiv.2501.06220,
title = {Powerful Design of Small Vision Transformer on CIFAR10},
author = {Gent Wu},
journal= {arXiv preprint arXiv:2501.06220},
year = {2025}
}