中文

语言在 CLIP 的对象-属性组合泛化中起关键作用

计算机视觉与模式识别 2024-03-28 v1 计算与语言 机器学习

摘要

视觉-语言模型(如 CLIP)在各种类型的分布偏移下展现出了有前景的分布外(OoD)泛化能力。近期的研究试图探究这种能力的主要原因。在本工作中,我们沿着相同的路径,但聚焦于一种特定类型的 OoD 数据——具有新颖属性-对象对组合的图像——并研究此类模型能否成功地将这些图像分类到相应的组合类别中。我们精心设计了一个真实的图像测试数据集,称为 ImageNet-AO,其中包含 CLIP 训练集中不太可能遇到的对象属性。我们发现,使用大型数据集(如 OpenAI CLIP、LAION-400M 和 LAION-2B)训练的 CLIP,在有效的组合 OoD 泛化方面,比监督模型和使用较小数据集(如 CC-12M 和 YFCC-15M)训练的 CLIP 表现出数量级的提升。我们的结果提供了证据,表明训练数据的规模和多样性以及语言监督在解锁视觉-语言模型的组合泛化能力中发挥着关键作用。

关键词

引用

@article{arxiv.2403.18525,
  title  = {Language Plays a Pivotal Role in the Object-Attribute Compositional Generalization of CLIP},
  author = {Reza Abbasi and Mohammad Samiei and Mohammad Hossein Rohban and Mahdieh Soleymani Baghshah},
  journal= {arXiv preprint arXiv:2403.18525},
  year   = {2024}
}

备注

Oral accepted at OODCV 2023(http://www.ood-cv.org)