中文

VL-Taboo:视觉-语言模型基于属性的零样本能力分析

计算机视觉与模式识别 2022-09-15 v1 人工智能 计算与语言

摘要

在大规模随机收集数据上训练的视觉-语言模型自出现以来已在诸多领域产生重大影响。尽管它们在图文检索等多个领域表现出优异性能,其内在机制仍未被充分理解。本文分析了此类模型的真实零样本能力。我们从分析训练语料库入手,评估测试类别在多大程度上(以及哪些)真正属于零样本,以及这与各类别性能的相关性。随后我们分析了这些模型基于属性的零样本学习能力,评估这种经典的零样本概念如何从大规模网络监督中浮现。我们利用最近发布的 LAION400M 语料库以及公开可用的 CLIP、OpenCLIP 和 FLAVA 预训练模型,在 CUB 和 AWA2 基准上评估基于属性的零样本能力。我们的分析表明:(i) 流行零样本基准中的大多数类别在预训练期间被(大量)观察到;(ii) 零样本性能主要源于模型在文本中出现类标签时识别类标签的能力,而仅在未使用类标签时才观察到性能显著较低的基于属性的零样本学习能力;(iii) 所用属性数量可能对性能产生显著影响,并容易引发显著的性能下降。

关键词

引用

@article{arxiv.2209.06103,
  title  = {VL-Taboo: An Analysis of Attribute-based Zero-shot Capabilities of Vision-Language Models},
  author = {Felix Vogel and Nina Shvetsova and Leonid Karlinsky and Hilde Kuehne},
  journal= {arXiv preprint arXiv:2209.06103},
  year   = {2022}
}