中文

青睐何种Transformer:视觉Transformer效率的比较分析

计算机视觉与模式识别 2025-02-25 v4 人工智能 机器学习

摘要

Transformer中的自注意力因其二次计算复杂度而带来高昂计算成本,但其在语言与视觉问题上的有效性激发了大量旨在提升效率的研究。然而,跨越多个输入域的多样化实验条件使得仅依据已报告结果进行公平比较变得不可能,给模型选择带来挑战。为弥补可比性上的这一缺口,我们对超过45个图像分类模型进行了大规模基准测试,评估了准确性、速度与内存占用等关键效率方面。我们的基准为面向效率的Transformer提供了标准化基线。我们基于帕累托前沿(最优模型的边界)对结果进行分析。令人惊讶的是,尽管有其他模型声称更高效,ViT在多项指标上仍保持帕累托最优。我们观察到,混合注意力-CNN模型展现出卓越的推理内存与参数效率。此外,我们的基准表明,总体而言使用更大的模型比使用更高分辨率图像更高效。得益于我们的整体评估,我们为从业者与研究者提供了集中化资源,便于在选用或开发高效Transformer时做出明智决策。

关键词

引用

@article{arxiv.2308.09372,
  title  = {Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers},
  author = {Tobias Christian Nauen and Sebastian Palacio and Federico Raue and Andreas Dengel},
  journal= {arXiv preprint arXiv:2308.09372},
  year   = {2025}
}

备注

v3: new models, analysis of scaling behaviors; v4: WACV 2025 camera ready version, appendix added