超越单一实力:面向通用视觉语言模型的定制化集成
计算机视觉与模式识别
2024-06-04 v2
摘要
微调预训练的视觉语言模型(VLMs,如 CLIP)以实现开放世界泛化因其实际价值而日益受到关注。然而,仅依靠为单一模型(即使是表现出强性能的模型,如 CLIP-ViT-B/16)设计复杂算法,性能提升有限。本文首次探索了利用更弱的 VLMs 的协作潜力来增强鲁棒单一模型的泛化能力。肯定的发现促使我们从新视角解决泛化问题,即预训练 VLMs 的集成。我们引入了三种定制化集成策略,每种针对一种特定场景。首先,我们提出零样本集成,在仅有预训练 VLMs 可用时,根据其置信度自动调整不同模型的 logits。此外,对于具有额外少样本数据的场景,我们提出无需训练和微调的集成,基于计算资源的可用性提供灵活性。所提集成策略在零样本、基到新和跨数据集泛化上进行了评估,取得了新的 SOTA 性能。值得注意的是,本工作是借助集成提升 VLMs 泛化性能的初步尝试。代码见 https://github.com/zhiheLu/Ensemble_VLM.git。
引用
@article{arxiv.2311.17091,
title = {Beyond Sole Strength: Customized Ensembles for Generalized Vision-Language Models},
author = {Zhihe Lu and Jiawang Bai and Xin Li and Zeyu Xiao and Xinchao Wang},
journal= {arXiv preprint arXiv:2311.17091},
year = {2024}
}
备注
Accepted on ICML 2024