面向视觉任务的Reformer是否必要?基于Vision Transformer的实验比较
计算机视觉与模式识别
2026-01-08 v2
摘要
Transformer最近在计算机视觉领域展现出强大的性能,Vision Transformer(ViT)通过自注意力机制捕获低层次和高层次图像特征。然而,标准ViT仍然计算开销大,因为全局自注意力的时间复杂度随token数量呈二次方增长,这限制了其在高分辨率输入和资源受限环境中的实际应用。本文我们探索Reformer架构作为替代视觉主干。通过将基于patch的分词与局部敏感哈希(LSH)注意力相结合,该模型在保持全局自注意力的同时,将其理论时间复杂度从 降低到 (其中序列长度为 )。我们在CIFAR-10上评估了基于Reformer的视觉模型以了解其在小规模数据集上的表现,在ImageNet-100上研究其在更真实场景下的精度-效率权衡,在高分辨率医学影像数据集上评估模型在更长token序列下的表现。虽然Reformer在CIFAR-10上准确率优于ViT基线,但在实验中ViT在实际效率和端到端计算时间方面 consistently 优于Reformer,这些结果表明,尽管LSH注意力在理论上具有优势,但要实现有意义的计算收益,序列长度需要远大于典型高分辨率图像所产生的序列长度。
引用
@article{arxiv.2512.11260,
title = {Do We Need Reformer for Vision? An Experimental Comparison with Vision Transformers},
author = {Ali El Bellaj and Mohammed-Amine Cheddadi and Rhassan Berber},
journal= {arXiv preprint arXiv:2512.11260},
year = {2026}
}