CLIP 是否绑定概念?探究大型图像模型的组合性
计算机视觉与模式识别
2024-09-02 v3 人工智能
计算与语言
摘要
结合文本和图像的大规模神经网络模型近年来取得了令人难以置信的进展。然而,此类模型在多大程度上编码了其所处理概念的组合表示,例如通过对“红”和“立方体”这两个组成部分进行推理来正确识别“红色立方体”,仍然是一个悬而未决的问题。在本工作中,我们关注大型预训练视觉与语言模型 (CLIP) 编码组合概念并以对结构敏感的方式绑定变量的能力(例如,区分“立方体在球体后方”与“球体在立方体后方”)。为了检验 CLIP 的性能,我们比较了来自组合分布语义模型 (CDSMs) 研究中的几种架构,该研究方向试图在嵌入空间内实现传统的组合语言结构。我们在三个合成数据集上对它们进行了基准测试——单物体、双物体和关系数据集——旨在测试概念绑定。我们发现 CLIP 能够在单物体设置下组合概念,但在需要概念绑定的情况下,其性能急剧下降。同时,CDSMs 的表现也很差,最佳性能仅处于随机水平。
引用
@article{arxiv.2212.10537,
title = {Does CLIP Bind Concepts? Probing Compositionality in Large Image Models},
author = {Martha Lewis and Nihal V. Nayak and Peilin Yu and Qinan Yu and Jack Merullo and Stephen H. Bach and Ellie Pavlick},
journal= {arXiv preprint arXiv:2212.10537},
year = {2024}
}
备注
Lewis and Nayak contributed equally