可迁移的模型无关视觉-语言模型适应方法以实现高效弱到强泛化
计算机视觉与模式识别
2026-01-21 v3 人工智能
机器学习
摘要
视觉-语言模型(VLMs)因其卓越的泛化能力而被广泛应用于各种视觉识别任务。随着这些模型规模和复杂性的增长,微调变得成本高昂,这凸显了重用来自“较弱”模型的适应知识以高效增强“较强”模型的需求。然而,现有的适应迁移方法由于其模型特定的设计和较高的计算需求,在不同模型间的可迁移性有限。为解决此问题,我们提出了可迁移的模型无关适配器(TransMiter),这是一种无需反向传播即可改进视觉-语言模型的轻量级适配器。TransMiter以无监督的方式捕捉预训练和微调VLM之间的知识差距。一旦训练完成,这些知识可以无缝迁移到不同模型,无需反向传播。此外,TransMiter仅由几层组成,引入的额外推理成本可忽略不计。值得注意的是,用少量标注数据补充该过程可进一步带来性能提升,通常能以极低的训练成本超越微调后的更强模型。实验结果和分析表明,TransMiter在视觉识别任务中,能有效且高效地在不同大小和架构的VLM之间迁移适应知识,同时保持泛化能力。
引用
@article{arxiv.2508.08604,
title = {Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization},
author = {Jihwan Park and Taehoon Song and Sanghyeok Lee and Miso Choi and Hyunwoo J. Kim},
journal= {arXiv preprint arXiv:2508.08604},
year = {2026}
}
备注
AAAI2026 Oral (camera ready version)