ViT-5:2020 年代中期的 Vision Transformer
计算机视觉与模式识别
2026-02-10 v1
摘要
本工作系统性地调查了通过利用过去五年的架构进步来现代化 Vision Transformer 背板的方法。虽然保持标准的 Attention-FFN 结构,但我们进行了归一化、激活函数、位置编码、门控机制和可学习标记等方面的组件级精炼。这些更新形成了下一代 Vision Transformer,我们称为 ViT-5。广泛的实验表明,ViT-5 在理解和生成基准测试中均一致优于最先进的纯 Vision Transformer。在 ImageNet-1k 分类任务中,ViT-5-Base 达到 84.2% 的 top-1 准确率,计算资源相当时,超过了 DeiT-III-Base 的 83.8%。ViT-5 也作为更强的生成模型背板:当集成到 SiT 扩散框架中时,FID 为 1.84,优于 vanilla ViT 背板的 2.06。除了亮点指标外,ViT-5 在表示学习和空间推理行为方面表现出更好的表征能力,并可可靠地跨任务迁移。具有面向当代 foundation-model 实践的设计,ViT-5 为 mid-2020 年代的视觉背板提供了简单可插即用的升级方案。
引用
@article{arxiv.2602.08071,
title = {ViT-5: Vision Transformers for The Mid-2020s},
author = {Feng Wang and Sucheng Ren and Tiezheng Zhang and Predrag Neskovic and Anand Bhattad and Cihang Xie and Alan Yuille},
journal= {arXiv preprint arXiv:2602.08071},
year = {2026}
}
备注
Code is available at https://github.com/wangf3014/ViT-5