面向双稳态图像的视觉-语言模型评估
计算机视觉与模式识别
2024-05-31 v1 人工智能
摘要
双稳态图像(也称为模糊或可逆图像)呈现出可以以两种不同解释观察的视觉刺激,尽管不能同时被观察者同时看见。在本研究中,我们首次对视觉-语言模型进行最为广泛的双稳态图像检验。我们手动收集了 29 幅双稳态图像及其相关标签,并对其进行 116 种亮度、色调和旋转的不同操作。我们在六种模型架构中评估了十二个不同模型,进行分类和生成任务。我们的发现表明,除 Idefics 系列模型和 LLaVA1.5-13b 外,模型对一种解释具有显著偏好,而在图像操作下几乎没有方差,仅在少数旋转情况下例外。此外,我们比较了模型偏好与人类的偏好,发现模型不 exhibit 与人类相同的连续性偏见,常常与人类的初始解释相异。我们还调查了不同提示和同义标签变化的影响,发现这些因素对模型解释的影响远大于图像操作,显示语言偏置对双稳态图像解释的影响更大于图像-文本训练数据。所有代码和数据均已开源。
引用
@article{arxiv.2405.19423,
title = {Evaluating Vision-Language Models on Bistable Images},
author = {Artemis Panagopoulou and Coby Melkin and Chris Callison-Burch},
journal= {arXiv preprint arXiv:2405.19423},
year = {2024}
}