视觉语言模型选择与重用的下游适应
机器学习
2025-05-08 v2 人工智能
摘要
预训练视觉语言模型(VLM)正在跨越各种视觉任务并日益受到欢迎,多个开源 VLM 变体也相继发布。然而,为特定下游任务选择表现最佳的预训练 VLM 具有挑战性,因为没有单个 VLM 能在所有下游任务上取得令人满意的性能,且由于时间和数据限制,评估所有可用的 VLM 也不可能。为此,本文提出了一种新颖的范式用于下游任务的 VLM 选择与重用,称为模型标签学习(Model Label Learning,简称 MLL)。该方案包含三个关键模块:模型标记(model labeling),为每个 VLM 分配标签以描述其专长和效用;模型选择(model selection),将目标任务的需求与模型标签匹配;模型重用(model reuse),以集成方式将所选 VLM 应用于目标任务。该方案计算效率极高且可扩展,因为模型标记过程独立于目标任务完成,且随候选 VLM 数量的增加而提升。我们还引入了一个用于评估 VLM 选择方法的新基准,包括 49 个 VLM 和 17 个目标任务数据集。实验结果清晰地证明了该方法在选择和重用 VLM 方面的有效性。
引用
@article{arxiv.2501.18271,
title = {Vision-Language Model Selection and Reuse for Downstream Adaptation},
author = {Hao-Zhe Tan and Zhi Zhou and Yu-Feng Li and Lan-Zhe Guo},
journal= {arXiv preprint arXiv:2501.18271},
year = {2025}
}
备注
Accepted by ICML 2025