中文

RePaViT:通过前馈网络层的结构重参数化实现可扩展 Vision Transformer 加速

计算机视觉与模式识别 2025-06-03 v2 人工智能

摘要

我们发现,前馈网络(FFN)层而非注意力层是 Vision Transformer (ViT) 推理延迟的主要来源,且其影响随模型规模增大而凸显。这一发现突显了通过聚焦 FFN 层来优化大规模 ViT 效率的关键机遇。本文提出了一种新颖的通道闲置机制,在测试阶段促进高效 FFN 层的训练后结构重参数化。具体而言,在每个 FFN 层中,一组特征通道保持闲置并绕过非线性激活函数,从而形成一条线性路径,在推理时实现结构重参数化。该机制产生了一系列可重参数化 Vision Transformer (RePaViT),在各种 ViT 中实现了显著的延迟降低,且精度损失可接受(有时甚至有所提升)。该方法的优势随模型规模一致扩展,在更大的模型上展现出更高的速度提升,且精度差距逐步缩小甚至精度更高。特别是,在相同的训练策略下,RePa-ViT-Large 和 RePa-ViT-Huge 分别获得了 66.8% 和 68.7% 的加速,且 top-1 精度分别提高了 +1.7% 和 +1.1%。据我们所知,RePaViT 是首个在 FFN 层上采用结构重参数化来加速 ViT 的方法,我们相信这代表了高效 ViT 的一个极具前景的方向。源代码可在 https://github.com/Ackesnal/RePaViT 获取。

关键词

引用

@article{arxiv.2505.21847,
  title  = {RePaViT: Scalable Vision Transformer Acceleration via Structural Reparameterization on Feedforward Network Layers},
  author = {Xuwei Xu and Yang Li and Yudong Chen and Jiajun Liu and Sen Wang},
  journal= {arXiv preprint arXiv:2505.21847},
  year   = {2025}
}

备注

Accepted to ICML2025