更厚更快:一种用于快速纯视觉Transformer的大型标记
计算机视觉与模式识别
2026-03-03 v4
摘要
视觉Transformer(ViTs)通用且准确,能解决许多任务,但ViTs速度较慢,在效率至关重要时并不实用。现有方法为更快的ViTs设计混合非ViT架构,牺牲了通用性,或缩小标记,牺牲了准确性。许多非ViT架构既快又准确。然而,在没有显著修改的情况下,它们无法做到ViT所能做到的事情:处理其他输入形状、通过SOTA自监督学习进行预训练、通过丢弃标记来减少计算等。我们通过减小patch标记宽度,同时通过添加新的大型标记来增加全局标记宽度,从而使ViT更快。我们更宽的大型标记由其自身更宽的前馈网络(FFN)处理,以增加模型容量。然而,我们的大型FFN是高效的:它只处理单个标记,以获得速度,其参数在所有层中共享,以获得内存。关键的是,我们的大型标记仅关注且非层级,类似于纯ViT,因此它简单、可扩展、灵活且与ViT方法兼容(包括新旧方法)。大型标记在从Nano到Large规模的ViT基线上均取得改进,同时在ImageNet-1K上保持速度/吞吐量(0.1-13%)。大型标记还改进了分割(ADE20K上提升1.9-3.1%)、MAE预训练(ImageNet-1K上线性探索提升4.9%)、测试时适应(ImageNet-C上提升5.2%)以及时间序列建模。我们的大型模型甚至在速度-准确性权衡方面优于专用的非ViT计算高效模型,同时保持纯ViT兼容性以实现实用性。代码和模型权重可用:https://github.com/antofuller/jumbo
关键词
引用
@article{arxiv.2502.15021,
title = {Thicker and Quicker: A Jumbo Token for Fast Plain Vision Transformers},
author = {Anthony Fuller and Yousef Yassin and Daniel G. Kyrollos and Evan Shelhamer and James R. Green},
journal= {arXiv preprint arXiv:2502.15021},
year = {2026}
}
备注
ICLR 2026