中文

弥合视觉-语言模型选择中的模态与能力差距

机器学习 2025-05-20 v3 计算机视觉与模式识别

摘要

视觉语言模型(VLM)通过将图像与文本类别名称配对,在零样本图像分类中表现出色。预训练 VLM 种类的不断增多,提高了为特定任务找到合适 VLM 的可能性。为了更好地重用 VLM 资源并充分挖掘其在不同零样本图像分类任务上的潜力,一种有前景的策略是仅依赖目标数据集的文本数据,而不访问数据集图像,从 VLM 动物园中选择合适的预训练 VLM。在本文中,我们分析了在这种仅依赖语言的 VLM 选择中评估 VLM 能力所面临的两个固有挑战:“模态差距”——VLM 在两种不同模态下的嵌入差异,使得文本成为图像不可靠的替代品;以及“能力差距”——VLM 的整体排名与其在目标数据集上的排名之间的差异,阻碍了从模型通用性能直接预测其特定数据集性能。我们提出了带差距弥合的 VLM 选择方法(SWAB)来减轻这两个差距的负面影响。SWAB 首先采用最优传输,通过传输矩阵捕获开源数据集与目标数据集之间的相关性。然后,它利用该矩阵将 VLM 的有用统计信息从开源数据集迁移到目标数据集,以弥合这两个差距。通过弥合两个差距以获得更好的测试图像替代品,SWAB 能够准确预测不同 VLM 在目标任务上的性能排名,而无需数据集的图像。在多种 VLM 和图像分类数据集上的实验验证了 SWAB 的有效性。

关键词

引用

@article{arxiv.2403.13797,
  title  = {Bridge the Modality and Capability Gaps in Vision-Language Model Selection},
  author = {Chao Yi and Yu-Hang He and De-Chuan Zhan and Han-Jia Ye},
  journal= {arXiv preprint arXiv:2403.13797},
  year   = {2025}
}

备注

fix typo in figure 2 "Capability Gap"