中文

面向视觉-语言模型的无监督原型适配器

计算机视觉与模式识别 2023-08-28 v2 计算与语言

摘要

近来,大规模预训练视觉-语言模型(如 CLIP 和 ALIGN)在获取可迁移视觉表征方面展现出显著效果。为利用这些模型中编码的宝贵知识服务于下游任务,若干微调方法,包括提示调优方法与基于适配器的方法,已被开发以有效地在有监督下适配视觉-语言模型。然而,这些方法依赖标注样本的可用性,而获取标注样本费时费力,从而限制了可扩展性。为解决此问题,本文设计了一种称为无监督原型适配器(UP-Adapter)的视觉-语言模型无监督微调方法。具体而言,对于未标注目标数据集,我们利用 CLIP 的文本-图像对齐能力为每个类自动选择最置信样本。利用这些所选样本,我们生成类原型,作为可学习原型模型的初始化。微调后,原型模型预测通过残差连接与原始 CLIP 预测相结合以执行下游识别任务。我们在图像识别与域泛化上的大量实验结果表明,所提无监督方法大幅优于 8-shot CoOp、8-shot Tip-Adapter 以及最先进的 UPL 方法。

关键词

引用

@article{arxiv.2308.11507,
  title  = {Unsupervised Prototype Adapter for Vision-Language Models},
  author = {Yi Zhang and Ce Zhang and Xueting Hu and Zhihai He},
  journal= {arXiv preprint arXiv:2308.11507},
  year   = {2023}
}

备注

Accepted by PRCV 2023