不止于文本:探索视觉语言模型中视觉表征的组合性
计算机视觉与模式识别
2025-03-24 v1 机器学习
摘要
视觉语言模型(Vision-Language Models, VLMs)学习文本与图像的共享特征空间,从而实现不同模态输入的比较。虽然已有研究表明VLMs将自然语言表征组织成编码复合含义的规则结构,但视觉嵌入空间中是否也出现组合模式仍不明确。本文研究视觉领域的组合性问题,由于视觉数据噪声和稀疏性,对组合性属性的分析面临挑战。我们提出了一种名为“测地线可分解嵌入(Geodesically Decomposable Embeddings, GDE)”的框架,通过几何感知的方式在潜在空间中逼近图像表征。我们证明,预训练VLMs的视觉嵌入呈现组合性布局,并评估了该特性在组合分类和组鲁棒性任务中的效果。GDE在组合分类任务上的性能优于假设潜在空间线性几何的对照方法。值得注意的是,对于组鲁棒性任务,GDE的成绩优于特定任务的解决方案。我们的结果表明,VLMs能够自动发展出类似人类的视觉领域组合推理能力,使其底层过程更具可解释性。代码已公开于 https://github.com/BerasiDavide/vlm_image_compositionality。
引用
@article{arxiv.2503.17142,
title = {Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models},
author = {Davide Berasi and Matteo Farina and Massimiliano Mancini and Elisa Ricci and Nicola Strisciuglio},
journal= {arXiv preprint arXiv:2503.17142},
year = {2025}
}
备注
Camera-ready version for CVPR 2025 (with Supp.Mat.)