SIGMA: 弥合视觉基础模型适配中的结构与分布差距
计算机视觉与模式识别
2026-05-28 v1
摘要
视觉基础模型(VFM)已经展示了令人印象深刻的表征能力。然而,通过全微调将它们适配到下游任务会带来高昂的计算和存储开销。参数高效微调(PEFT)作为一种有吸引力的替代方案出现,旨在以最小的训练成本实现与全微调相当的性能。尽管如此,由于结构和分布上的差距,将PEFT应用于VFM进行密集预测任务仍然具有挑战性。为了弥合这些差距,我们提出了尺度集成全局调制适配器(SIGMA),一种新颖的轻量级PEFT方法,它由两个模块组成:尺度自适应融合和语义调制。具体来说,尺度自适应融合模块用于通过增强多粒度视觉信息的提取来弥合结构差距。此外,SIGMA在融合特征上引入语义调制以执行全局特征对齐,从而进一步消除分布差距。这种设计促进了统一的空间和分布适配,相对于VFM骨干网络仅需要1.72%的可训练参数。跨各种下游密集任务和多个VFM骨干网络的综合实验表明,SIGMA在性能上一致且优于最先进的PEFT方法。
引用
@article{arxiv.2605.27893,
title = {SIGMA: Bridging Structural and Distributional Gaps for Vision Foundation Model Adaptation},
author = {Lingyu Xiong and Jinjin Shi and Xuran Xu and Cong Luo and Runyu Shi and Ying Huang},
journal= {arXiv preprint arXiv:2605.27893},
year = {2026}
}