JourneyBench: 一个挑战性的一站式生成图像视觉语言理解基准
计算机视觉与模式识别
2025-01-13 v4 人工智能
摘要
现有的视觉语言理解基准大多由常规情境中物体的图像组成,结果导致近期多模态大语言模型仅通过浅层视觉理解即可取得好成绩,因其依赖背景语言偏差。因此,优异的基准表现不一定反映出强大的视觉理解能力。本文我们发布JourneyBench,一个全面人工标注的生成图像基准,旨在评估模型在五个任务上的细粒度多模态推理能力: 互补多模态思维链、多图VQA、虚构图像描述、带幻觉触发器的VQA以及带样本特定干扰项的细粒度检索。与现有基准不同,JourneyBench明确要求在语言偏差和整体图像意图不足以应对的异常虚构情境中进行细粒度多模态推理。我们对基准中最先进的模型进行评估,并沿多个细粒度维度分析性能。所有五个任务的结果表明,JourneyBench对即便是最佳模型也具有极高挑战性,表明模型的视觉推理能力并不如人们最初所想的那样强。我们讨论了发现的含义,并提出了进一步研究的方向。
引用
@article{arxiv.2409.12953,
title = {JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images},
author = {Zhecan Wang and Junzhang Liu and Chia-Wei Tang and Hani Alomari and Anushka Sivakumar and Rui Sun and Wenhao Li and Md. Atabuzzaman and Hammad Ayyubi and Haoxuan You and Alvi Ishmam and Kai-Wei Chang and Shih-Fu Chang and Chris Thomas},
journal= {arXiv preprint arXiv:2409.12953},
year = {2025}
}