视觉与语言模型中的跨模态关联:重审巴布卡-几卡效应
计算机视觉与模式识别
2025-10-16 v2 计算与语言
摘要
近期 multimodal 模型的进展引发了关于视觉-语言模型(VLMs)是否以反映人类认知方式整合跨模态信息的问题。该领域的一个经典测试案例是巴布卡-几卡效应,人类可靠地将类似 'bouba' 的伪词与圆形图形关联,将 'kiki' 与尖锐图形关联。鉴于先前研究在 VLMs 中发现的该效应的混合证据,本文对两种 CLIP 变体(ResNet 和视觉 Transformer(ViT))进行全面重评,这两种模型在众多 SOTA VLMs 中占据核心地位。我们应用两种互补方法,紧密模仿人类实验:基于提示的评估使用概率作为模型偏好度量,并使用 Grad-CAM 作为解释形状-单词匹配任务中视觉注意力的新方法。我们的发现表明,这些模型变体并不一致地表现出巴布卡-几卡效应。虽然 ResNet 显示出对圆形图形的偏好,但总体而言,两种模型变体的表现均不符合预期的关联。此外,直接与先前人类数据进行比较显示,这些模型的响应在模态整合行为方面远远不足以匹配人类认知的稳健特性。这些结果促进了关于 VLMs 是否真正理解跨模态概念的 ongoing 讨论,突显了其内部表征和与人类直觉对齐方面的局限性。
引用
@article{arxiv.2507.10013,
title = {Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect},
author = {Tom Kouwenhoven and Kiana Shahrasbi and Tessa Verhoef},
journal= {arXiv preprint arXiv:2507.10013},
year = {2025}
}
备注
Presented at the Thirty-Ninth Annual Conference on Neural Information Processing Systems (2025)