中文

SuS-X:视觉-语言模型的免训练仅名称迁移

计算机视觉与模式识别 2023-08-16 v4 计算与语言 多媒体

摘要

对比语言-图像预训练(CLIP)已成为训练大规模视觉-语言模型的一种简单而有效的方式。CLIP 在多种下游任务上展现出令人印象深刻的零样本分类与检索能力。然而,要发挥其全部潜力,微调似乎仍是必要的。对整个 CLIP 模型进行微调可能耗费大量资源且不稳定。此外,近期旨在规避此微调需求的方法仍需要访问来自目标分布的图像。本文中,我们采取不同思路,探索免训练“仅名称迁移”机制,其中我们关于下游任务的唯一知识仅包含下游目标类别的名称。我们提出一种新方法 SuS-X,由两个关键构件——SuS 与 TIP-X 组成,既不需要密集微调,也不需要昂贵的标注数据。SuS-X 在 19 个基准数据集上实现了最先进的零样本分类结果。我们进一步展示了 TIP-X 在免训练少样本设定中的效用,再次相对于强免训练基线取得最先进结果。代码见 https://github.com/vishaal27/SuS-X。

关键词

引用

@article{arxiv.2211.16198,
  title  = {SuS-X: Training-Free Name-Only Transfer of Vision-Language Models},
  author = {Vishaal Udandarao and Ankush Gupta and Samuel Albanie},
  journal= {arXiv preprint arXiv:2211.16198},
  year   = {2023}
}

备注

Accepted at ICCV2023