两种效应,一个触发因素:论对比式视觉-语言模型中的模态鸿沟、物体偏差与信息不平衡
计算机视觉与模式识别
2025-04-17 v3 机器学习
摘要
对比式视觉-语言模型(VLM),如 CLIP,因其在各种下游任务中的广泛适用性而受到欢迎。尽管它们在某些任务中取得了成功,如零样本物体识别,但在其他任务中表现令人惊讶地差,如属性识别。先前的工作将这些挑战归因于模态鸿沟,即图像和文本在共享表示空间中的分离,以及相对于其他因素(如属性)对物体的偏差。在这篇分析论文中,我们彻底研究了这两种现象。我们评估了现成的 VLM,虽然鸿沟对性能的影响通常被其他因素掩盖,但我们发现有迹象表明缩小鸿沟确实会带来改进。此外,我们发现与直觉相反,仅有少数嵌入维度驱动了鸿沟,且嵌入空间的组织方式不同。为了能够干净地研究物体偏差,我们引入了其定义和相应的度量。借助这一工具,我们发现物体偏差并不会导致其他概念(如属性本身)的性能下降。然而,为什么模态鸿沟和物体偏差这两种现象首先会出现?为了回答这一基本问题并揭示对比式 VLM 的一些内部工作原理,我们进行了实验,使我们能够控制模态之间共享信息的数量。这些实验揭示了模态鸿沟和物体偏差背后的驱动因素是图像和标题之间的信息不平衡,并揭示了模态鸿沟与 logits 熵之间的有趣联系。
引用
@article{arxiv.2404.07983,
title = {Two Effects, One Trigger: On the Modality Gap, Object Bias, and Information Imbalance in Contrastive Vision-Language Models},
author = {Simon Schrodi and David T. Hoffmann and Max Argus and Volker Fischer and Thomas Brox},
journal= {arXiv preprint arXiv:2404.07983},
year = {2025}
}
备注
ICLR 2025 (Oral)