视觉与语言编码器对世界的表征是否相似?
计算机视觉与模式识别
2024-03-26 v2 人工智能
计算与语言
机器学习
摘要
对齐的文本-图像编码器(如CLIP)已成为视觉-语言任务的事实标准模型。此外,模态特定的编码器在各自领域取得了令人印象深刻的性能。这引出一个核心问题:由于单模态视觉和语言编码器从根本上表征同一个物理世界,它们之间是否存在对齐?我们使用中心核对齐(CKA)方法,在图像-标题基准上分析视觉和语言模型潜在空间的结构,发现未对齐编码器与对齐编码器的表征空间在语义上是相似的。在对齐编码器(如CLIP)缺乏统计相似性的情况下,我们展示了未对齐编码器之间无需任何训练即可存在一种可能的匹配。我们将此问题构建为一个利用图之间语义相似性的种子图匹配问题,并提出两种方法——一种快速二次分配问题优化,以及一种新颖的基于局部CKA度量的匹配/检索方法。我们在多个下游任务(包括跨语言、跨域标题匹配和图像分类)上展示了其有效性。代码可在github.com/mayug/0-shot-llm-vision获取。
引用
@article{arxiv.2401.05224,
title = {Do Vision and Language Encoders Represent the World Similarly?},
author = {Mayug Maniparambil and Raiymbek Akshulakov and Yasser Abdelaziz Dahou Djilali and Sanath Narayan and Mohamed El Amine Seddik and Karttikeya Mangalam and Noel E. O'Connor},
journal= {arXiv preprint arXiv:2401.05224},
year = {2024}
}
备注
Accepted CVPR 2024