中文

TUBench:面向不可解问题的大型视觉语言模型可信度基准测试

计算机视觉与模式识别 2024-10-08 v1 计算与语言

摘要

大型视觉语言模型(LVLMs)在视觉感知和语言解释方面取得了显著进展。尽管具备优异能力,但LVLMs仍存在幻觉问题,即生成不正确或不忠实于视觉或文本输入的内容。传统基准测试如MME和POPE在视觉问答(VQA)范围内使用可解问题评估LVLMs的幻觉问题,但部分问题因图像信息不足而不可解,LVLMs针对此类不可解问题的表现尚未得到充分探讨。为弥合这一研究空白,我们提出TUBench,一个专为评估LVLMs在不可解问题下的可靠性而设计的基准测试。TUBench包含大量高质量不可解问题,通过十种不同策略精心构建。为全面评估LVLMs,TUBench中的不可解问题基于来自四个多样化领域的图像作为视觉语境:代码片段截图、自然图像、几何图 diagram 和统计表格截图。这些不可解问题旨在测试LVLMs在代码推理、常识推理、几何推理和与表格相关的数学推理方面的可信度。我们对28个领先基础模型在TUBench上的进行了全面量化评估,排名第一的Gemini-1.5-Pro在确定问题是否可解方面获得69.2%的平均准确率,第三名的GPT-4o获得66.7%的平均准确率。TUBench已公开于https://github.com/NLPCode/TUBench。

关键词

引用

@article{arxiv.2410.04107,
  title  = {TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions},
  author = {Xingwei He and Qianru Zhang and A-Long Jin and Yuan Yuan and Siu-Ming Yiu},
  journal= {arXiv preprint arXiv:2410.04107},
  year   = {2024}
}