对比视觉-语言模型中的感知分组
计算机视觉与模式识别
2023-08-23 v3 机器学习
摘要
零样本图像识别的最新进展表明,视觉-语言模型学习到了具有高度语义信息的通用视觉表征,可用自然语言短语任意探测。然而,理解图像不仅仅在于理解图像中有什么内容,同样重要的是理解这些内容位于何处。本工作中,我们考察视觉-语言模型在理解物体位于图像中何处以及将图像中视觉相关部分分组方面的能力。我们展示了基于对比损失与大规模网络数据的当代视觉与语言表征学习模型所捕获的物体定位信息有限。我们提出了一组最小修改,使模型独特地学习到语义与空间信息。我们从零样本图像识别、无监督自底向上与自顶向下语义分割以及鲁棒性分析等方面度量该性能。我们发现所得模型在无监督分割方面达到了最先进(SOTA)结果,并证明所学表征对旨在探测视觉模型因果行为的数据集中的伪相关具有独特的鲁棒性。
引用
@article{arxiv.2210.09996,
title = {Perceptual Grouping in Contrastive Vision-Language Models},
author = {Kanchana Ranasinghe and Brandon McKinzie and Sachin Ravi and Yinfei Yang and Alexander Toshev and Jonathon Shlens},
journal= {arXiv preprint arXiv:2210.09996},
year = {2023}
}
备注
Accepted and presented at ICCV 2023