MM-R$^3$:论视觉语言模型(VLM)的(不)一致性
计算机视觉与模式识别
2025-06-30 v2
摘要
随着LLM及其变体的出现,大量研究涌现,分析这些模型在一系列任务上的表现。虽然大多数研究通过任务准确率(例如,视觉问答、定位)来评估最先进(SoTA)视觉语言模型(VLM)的能力,但我们的工作探索了相关但互补的方面——一致性,即VLM对语义相似查询产生语义相似或相同响应的能力。我们注意到,一致性是VLM鲁棒性和可信度的基本前提(必要但不充分条件)。基于这一观点,我们提出了MM-R3基准,使我们能够从一致性和准确性的角度,分析SoTA VLM在三个任务上的表现:问题重述、图像风格迁移和上下文推理。我们的分析表明,一致性并不总是与准确性一致,这表明准确率更高的模型不一定更一致,反之亦然。此外,我们提出了一种简单而有效的缓解策略,即训练一个适配器模块来最小化跨提示的不一致性。通过我们提出的策略,我们能够在广泛使用的VLM(如BLIP-2和LLaVa 1.5M)上,相对于其现有版本,在一致性方面平均实现5.7%和12.5%的绝对提升。
引用
@article{arxiv.2410.04778,
title = {MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs)},
author = {Shih-Han Chou and Shivam Chandhok and James J. Little and Leonid Sigal},
journal= {arXiv preprint arXiv:2410.04778},
year = {2025}
}