加速视觉基础模型的深度可分离卷积
计算机视觉与模式识别
2026-05-22 v1
摘要
预训练的视觉基础模型在有限微调的情况下能提供卓越的性能,但其Vision Transformer(ViT)主干结构带来高的推理成本,限制了在资源受限设备上的部署。本文通过利用某些注意力头固有的类卷积行为,加速大规模预训练ViT,同时保持其特征提取能力。具体而言,我们引入一种高效的深度可分离卷积层,作为这些注意力头的即插即用替换方案。此外,我们提出了简单策略以识别哪些注意力头可以被替换,并引入微调程序以恢复下游任务性能。在图像分类和分割任务上,我们的方法实现了17-20%的推理加速,同时保持最小的性能退化。我们通过详细推导、广泛实验和效率基准进行了验证。该参考实现已公开。
引用
@article{arxiv.2605.22132,
title = {Accelerating Vision Foundation Models with Drop-in Depthwise Convolution},
author = {Carmelo Scribano and Mohammad Mahdi and Nedyalko Prisadnikov and Yuqian Fu and Giorgia Franchini and Danda Pani Paudel and Marko Bertogna and Luc Van Gool},
journal= {arXiv preprint arXiv:2605.22132},
year = {2026}
}
备注
Accepted at ICPR 2026