中文

基于冗余消除的参数无fine-tuning方法用于视觉基础模型

计算机视觉与模式识别 2025-11-11 v2 人工智能

摘要

视觉基础模型(Vision foundation models,VFMs)在学习通用视觉表征方面展现出惊人的能力。然而,常规做法需要参数更新才能适配下游任务,即使是参数高效微调方法也需要修改数千至数百万个权重。本文我们考察 SAM(Segment Anything Model)中的冗余,并提出一种新颖的参数无fine-tuning方法。不同于传统微调方法调整参数,本方法强调选择、复用和增强预训练特征,为微调基础模型提供了新的视角。具体而言,我们引入一种基于模型输出差异的通道选择算法,以识别冗余且有效的通道。通过有选择地用更有效的通道替换冗余通道,我们过滤掉不太有用的特征,并复用更多与下游任务无关的特征,从而增强任务特定的特征表征。在不在域和在域数据集上的实验表明,我们的方法在不同视觉任务(如图像分割、深度估计和图像分类)上具有高效且有效。值得注意的是,我们的方法可以无缝集成到现有微调策略(如 LoRA、Adapter)中,进一步提升已微调模型的性能。此外,由于我们的通道选择仅涉及模型推理,显著降低了 GPU 内存开销。

关键词

引用

@article{arxiv.2504.08915,
  title  = {Parameter-Free Fine-tuning via Redundancy Elimination for Vision Foundation Models},
  author = {Jiahuan Long and Tingsong Jiang and Wen Yao and Yizhe Xiong and Zhengqin Xu and Shuai Jia and Hanqing Liu and Chao Ma},
  journal= {arXiv preprint arXiv:2504.08915},
  year   = {2025}
}

备注

Accepted by AAAI 2026