中文

利用超级注意力增强紧凑卷积Transformer

计算机视觉与模式识别 2025-08-27 v1 机器学习

摘要

在本文中,我们提出了一种视觉模型,该模型采用token混合、序列池化和卷积分词器,以在固定上下文长度任务中实现最先进的性能和高效的推理。在CIFAR100基准测试中,我们的模型显著提升了基线模型的前1%和前5%验证准确率,分别从36.50%提高到46.29%以及从66.33%提高到76.31%,同时当上下文长度小于嵌入维度时,其效率高于缩放点积注意力(SDPA)Transformer,且规模仅为后者的60%。此外,该架构展现出极高的训练稳定性,且不依赖于诸如mixup数据增强、位置嵌入或学习率调度等技术。我们在Github上公开了我们的代码。

关键词

引用

@article{arxiv.2508.18960,
  title  = {Enhancing compact convolutional transformers with super attention},
  author = {Simpenzwe Honore Leandre and Natenaile Asmamaw Shiferaw and Dillip Rout},
  journal= {arXiv preprint arXiv:2508.18960},
  year   = {2025}
}

备注

9 pages, 4 figures