基于潜在层次化适配器的细粒度视觉语言模型微调
计算机视觉与模式识别
2025-08-18 v1
摘要
适配器方法在针对 few-shot 分类任务微调预训练视觉语言模型 (VLM) 时引起广泛关注。这些方法致力于开发一种轻量级模块,更好地对齐视觉和 (类别) 文本表示,从而提高在下游 few-shot 学习任务上的性能。然而,现有的适配器通常通过显式的空间相似性来学习/对齐 (类别) 视觉模态,这会 i) 无法捕捉类别与图像样本之间固有的多对一关联,ii) 难以在未知类别和图像之间建立准确的关联。为此,灵感来自最近的双曲学习工作,我们为 VLM 在下游 few-shot 分类任务开发了一种新型潜在层次化适配器 (LatHAdapter)。LatHAdapter 的核心是利用下游训练数据的潜在语义层次结构,并用于为适配器学习过程提供更丰富、细粒度的指导。具体而言,LatHAdapter 首先引入一些可学习的“属性”提示作为桥梁,将类别和图像对齐。然后,它在双曲空间中将类别、属性提示和图像投射到同一嵌入空间,并采用层次正则化来学习它们的潜在语义层次,从而充分建模类别、可学习属性和图像样本之间固有的多对一关联。在四个具有挑战性的 few-shot 任务上的大量实验表明,所提出的 LatHAdapter 在许多其他微调方法中 consistently outperform,尤其是在已知类别的适应和对未知类别的泛化方面。
关键词
引用
@article{arxiv.2508.11176,
title = {Fine-Grained VLM Fine-tuning via Latent Hierarchical Adapter Learning},
author = {Yumiao Zhao and Bo Jiang and Yuhe Ding and Xiao Wang and Jin Tang and Bin Luo},
journal= {arXiv preprint arXiv:2508.11176},
year = {2025}
}