中文

视觉-语言模型的黑盒少样本自适应

计算机视觉与模式识别 2023-08-21 v3 计算与语言 机器学习

摘要

通过对比学习训练以对齐视觉与语言模态的视觉-语言(V-L)模型已被证明是强大的少样本学习器。软提示学习是用于少样本下游自适应的首选方法,旨在弥合由新领域引起的分布偏移所导致的模态鸿沟。尽管参数高效,提示学习仍需访问模型权重,并且对于拥有数十亿参数的大型模型在计算上可能不可行。为解决这些不足,本文中我们描述了一种用于 V-L 少样本自适应的黑盒方法,其(a)作用于预计算的图像与文本特征,因此无需访问模型权重即可工作,(b)在训练时快几个数量级,(c)适用于监督与无监督训练,且(d)甚至可用于对齐从单模态模型计算的图像与文本特征。为此,我们提出线性特征对齐(LFA),一种用于目标域中 V-L 重新对齐的简单线性方法。LFA 从最小二乘问题的闭式解初始化,然后通过最小化重排序损失进行迭代更新。尽管简单,如 11 个图像和 2 个视频数据集上的大量实验所示,我们的方法甚至可超越软提示学习方法。

关键词

引用

@article{arxiv.2304.01752,
  title  = {Black Box Few-Shot Adaptation for Vision-Language models},
  author = {Yassine Ouali and Adrian Bulat and Brais Martinez and Georgios Tzimiropoulos},
  journal= {arXiv preprint arXiv:2304.01752},
  year   = {2023}
}

备注

Published at ICCV 2023