中文

SEED-Bench-2-Plus:以富文本视觉理解评估多模态大语言模型

计算机视觉与模式识别 2024-04-26 v1

摘要

理解富文本视觉内容对于多模态大语言模型(MLLM)的实际应用至关重要,因为富文本场景在现实世界中无处不在,其特征是图像中嵌入了大量文本。近期,具备出色通用性的 MLLM 的出现提高了我们对 MLLM 的期望。然而,它们在富文本场景中的能力尚未得到全面且客观的评估,因为当前的 MLLM 基准主要侧重于评估一般视觉理解。在本工作中,我们引入了 SEED-Bench-2-Plus,一个专门设计用于评估 MLLM **富文本视觉理解**的基准。我们的基准包含 2.3K 道带有精确人工标注的多项选择题,涵盖三大类别:图表、地图和网页,每一类都涵盖了现实世界中广泛的富文本场景。这些类别由于其固有的复杂性和多样性,有效地模拟了现实世界的富文本环境。我们进一步对 34 个著名的 MLLM(包括 GPT-4V、Gemini-Pro-Vision 和 Claude-3-Opus)进行了全面评估,并强调了 MLLM 在富文本视觉理解方面的当前局限性。我们希望我们的工作能作为现有 MLLM 基准的有益补充,提供有洞察力的观察,并激发 MLLM 在富文本视觉理解领域的进一步研究。数据集和评估代码可在 https://github.com/AILab-CVC/SEED-Bench 获取。

关键词

引用

@article{arxiv.2404.16790,
  title  = {SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension},
  author = {Bohao Li and Yuying Ge and Yi Chen and Yixiao Ge and Ruimao Zhang and Ying Shan},
  journal= {arXiv preprint arXiv:2404.16790},
  year   = {2024}
}