揭示大型视觉-语言模型中一致性的图景
计算机视觉与模式识别
2024-10-08 v4
摘要
大型视觉-语言模型近期取得了快速进展,在视觉信息的感知和推理能力方面表现出色。然而,当面对不同大小解空间的提示时,大型视觉-语言模型在相同知识点上往往无法给出一致的答案。这种不同解空间之间答案的不一致性在大型视觉-语言模型中普遍存在,并削弱了信任。为此,我们提供了一个多模态基准ConBench,用于直观分析当提示的解空间围绕一个知识点时,大型视觉-语言模型的表现如何。基于ConBench工具,我们首次揭示了这一图景,并得到以下发现:(1)在判别领域,提示的解空间越大,答案的准确率越低。(2)建立了判别领域与生成领域之间的关系:判别问题类型的准确率与其与标题的一致性呈强正相关。(3)与开源模型相比,闭源模型在一致性方面表现出明显的偏差优势。最终,我们通过基于触发器的诊断细化改进了大型视觉-语言模型的一致性,间接提升了其标题的性能。我们希望本文能加速研究社区更好地评估其模型,并鼓励一致性领域的未来进展。项目地址:https://github.com/foundation-multimodal-models/ConBench。
引用
@article{arxiv.2405.14156,
title = {Unveiling the Tapestry of Consistency in Large Vision-Language Models},
author = {Yuan Zhang and Fei Xiao and Tao Huang and Chun-Kai Fan and Hongyuan Dong and Jiawen Li and Jiacong Wang and Kuan Cheng and Shanghang Zhang and Haoyuan Guo},
journal= {arXiv preprint arXiv:2405.14156},
year = {2024}
}
备注
Accepted by NeurIPS 2024