ViT-Split:通过高效分割注意力头释放视觉基础模型的力量
计算机视觉与模式识别
2025-07-22 v2
摘要
视觉基础模型(VFMs)在广泛的下游任务上表现出惊人的性能。虽然Several VFM适配器通过利用VFMs的先验知识显示出有前景的效果,但我们识别出这些方法的两个效率问题:其一,卷积神经网络(CNN)与VFM骨干网络之间的交互会触发早期层的梯度反向传播;其二,现有方法需要调整所有组件,增加复杂度。此外,这些适配器会改变VFMs的特征,未充分利用先验知识。为解决这些挑战,我们提出一种新方法,称为ViT-Split,基于以下关键观察:若干VFMs(如DINOv2)的层可以分为两个 distinct 组件:用于学习低层特征的提取器,以及用于学习任务特定特征的适配器。凭借这一洞见,我们消除了CNN分支,向冻结的VFM引入两个头:任务头和先验头,以学习任务特定特征,缓解早期梯度传播问题;而先验头用于利用来自冻结VFM的多尺度先验特征,减少调参参数和过拟合。针对各种任务(如分割、检测、深度估计和视觉问答)进行大量实验,验证了ViT-Split的有效性与效率。具体而言,ViT-Split在训练时间上可减少最高达,而在ADE20K等数据集上实现与其他VFM适配器相当甚至更好的效果。
引用
@article{arxiv.2506.03433,
title = {ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads},
author = {Yifan Li and Xin Li and Tianqin Li and Wenbin He and Yu Kong and Liu Ren},
journal= {arXiv preprint arXiv:2506.03433},
year = {2025}
}
备注
The project is available: https://jackyfl.github.io/vitsplit.github.io/