中文

加速视觉基础模型的深度可分离卷积

计算机视觉与模式识别 2026-05-22 v1

摘要

预训练的视觉基础模型在有限微调的情况下能提供卓越的性能,但其Vision Transformer(ViT)主干结构带来高的推理成本,限制了在资源受限设备上的部署。本文通过利用某些注意力头固有的类卷积行为,加速大规模预训练ViT,同时保持其特征提取能力。具体而言,我们引入一种高效的深度可分离卷积层,作为这些注意力头的即插即用替换方案。此外,我们提出了简单策略以识别哪些注意力头可以被替换,并引入微调程序以恢复下游任务性能。在图像分类和分割任务上,我们的方法实现了17-20%的推理加速,同时保持最小的性能退化。我们通过详细推导、广泛实验和效率基准进行了验证。该参考实现已公开。

关键词

引用

@article{arxiv.2605.22132,
  title  = {Accelerating Vision Foundation Models with Drop-in Depthwise Convolution},
  author = {Carmelo Scribano and Mohammad Mahdi and Nedyalko Prisadnikov and Yuqian Fu and Giorgia Franchini and Danda Pani Paudel and Marko Bertogna and Luc Van Gool},
  journal= {arXiv preprint arXiv:2605.22132},
  year   = {2026}
}

备注

Accepted at ICPR 2026