基于奇异值的 CLIP-SVD:高效且可解释的视觉语言适配
计算机视觉与模式识别
2026-04-23 v3 计算与语言
摘要
视觉语言模型(VLMs)如CLIP在跨越多样化应用场景时展现出惊人的零样本和少样本学习能力。然而,针对新细粒度领域的适配仍然困难,因为依赖prompt工程且需要高昂的完整模型微调成本。现有适配方法依赖增强组件,如prompt token和adapter模块,这可能限制适配质量,导致模型不稳定,并削弱预训练期间所学丰富知识。在本工作中,我们提出CLIP-SVD,一个多模态且参数高效的适配框架,将奇异值微调(SVF)应用于CLIP,利用奇异值分解(SVD)修改CLIP内部参数空间,而无需注入额外模块。具体而言,我们仅微调CLIP参数矩阵的奇异值,以重新缩放 basis 向量进行领域适配,同时保留预训练模型。这种设计使我们仅需使用模型总参数的0.04%即可实现更好的适配性能,并更好地保留其泛化能力。CLIP-SVD在11个自然数据集和10个生物医学数据集上实现了最先进的分类结果,在准确率和泛化能力方面均优于先前方法,尤其是在少样本设置下。此外,我们利用基于自然语言的方法分析CLIP适配的有效性和动态性,以实现对CLIP-SVD的可解释性。总体而言,本工作提供了对SVD在视觉语言模型环境中进行微调的首个大规模实证评估。代码和生物医学语料库已公开于https://github.com/HealthX-Lab/CLIP-SVD。
引用
@article{arxiv.2509.03740,
title = {CLIP-SVD: Efficient and Interpretable Vision-Language Adaptation via Singular Values},
author = {Taha Koleilat and Hassan Rivaz and Yiming Xiao},
journal= {arXiv preprint arXiv:2509.03740},
year = {2026}
}
备注
TMLR 2026