中文

视觉-语言预训练模型是否学习了可组合的基元概念?

计算机视觉与模式识别 2023-05-30 v3 人工智能

摘要

视觉-语言(VL)预训练模型在多模态推理与零样本识别任务上取得了令人印象深刻的性能。许多此类 VL 模型在互联网上未标记的图像与标题对上进行预训练。本文中,我们研究基元概念——如颜色、形状或物体部件的属性——的表示是否在这些预训练 VL 模型中自动涌现。我们提出一个两步框架,即组合概念映射(CompMap),以探究此问题。CompMap 首先让 VL 模型通过文本提示生成基元概念激活,然后学习构建组合模型,将基元概念激活(如黑尾或红翼的可能性)映射到复合概念(如红翅黑鹂)。我们表明组合模型可可靠地从真实基元概念中学习。因此我们假设,若基元概念确实在 VL 预训练模型中涌现,则其基元概念激活可用于学习与专家设计的模型相似的组成模型。我们提出一种定量指标衡量相似程度,并称该指标为可解释性指标。我们还测量使用基元概念激活与学习到的组合模型预测复合概念时的分类准确率,并称其为有用性指标。我们的研究揭示,最先进的 VL 预训练模型学习到的基元概念对 CUB 数据集上的细粒度视觉识别以及 MIT-States 数据集上的组合泛化任务高度有用。然而,我们观察到所学组合模型在定性分析中可解释性较低。我们的结果揭示了现有 VL 模型的局限性,以及鼓励获取基元概念的预训练目标的必要性。

关键词

引用

@article{arxiv.2203.17271,
  title  = {Do Vision-Language Pretrained Models Learn Composable Primitive Concepts?},
  author = {Tian Yun and Usha Bhalla and Ellie Pavlick and Chen Sun},
  journal= {arXiv preprint arXiv:2203.17271},
  year   = {2023}
}

备注

Published in Transactions on Machine Learning Research (TMLR) 2023