面向视觉-语言模型的无监督原型适配器
计算机视觉与模式识别
2023-08-28 v2 计算与语言
摘要
近来,大规模预训练视觉-语言模型(如 CLIP 和 ALIGN)在获取可迁移视觉表征方面展现出显著效果。为利用这些模型中编码的宝贵知识服务于下游任务,若干微调方法,包括提示调优方法与基于适配器的方法,已被开发以有效地在有监督下适配视觉-语言模型。然而,这些方法依赖标注样本的可用性,而获取标注样本费时费力,从而限制了可扩展性。为解决此问题,本文设计了一种称为无监督原型适配器(UP-Adapter)的视觉-语言模型无监督微调方法。具体而言,对于未标注目标数据集,我们利用 CLIP 的文本-图像对齐能力为每个类自动选择最置信样本。利用这些所选样本,我们生成类原型,作为可学习原型模型的初始化。微调后,原型模型预测通过残差连接与原始 CLIP 预测相结合以执行下游识别任务。我们在图像识别与域泛化上的大量实验结果表明,所提无监督方法大幅优于 8-shot CoOp、8-shot Tip-Adapter 以及最先进的 UPL 方法。
引用
@article{arxiv.2308.11507,
title = {Unsupervised Prototype Adapter for Vision-Language Models},
author = {Yi Zhang and Ce Zhang and Xueting Hu and Zhihai He},
journal= {arXiv preprint arXiv:2308.11507},
year = {2023}
}
备注
Accepted by PRCV 2023