中文

LogicVista: 视觉上下文中的多模态大语言模型逻辑推理基准

人工智能 2024-07-09 v1 计算与语言 计算机视觉与模式识别 机器学习

摘要

我们提出了 LogicVista,这是一个评估基准,用于评估多模态大语言模型(MLLMs)在视觉上下文中的综合逻辑推理能力。多模态大语言模型的最新进展展示了各种令人着迷的能力,从根据图像创作诗歌到执行数学推理。然而,对于 MLLMs 在逻辑推理任务(这些任务对于导航和谜题解决等活动至关重要)中的熟练程度,仍然缺乏系统性的评估。因此,我们通过使用 448 道多项选择题的样本,评估了涵盖 9 种不同能力的 5 项逻辑推理任务中的通用逻辑认知能力。每个问题都标注了正确答案以及选择背后的人工推理过程,从而支持开放式和多项选择两种评估方式。我们使用 LogicVista 对总共 8 个 MLLMs 进行了全面评估。代码和数据可在 https://github.com/Yijia-Xiao/LogicVista 获取。

关键词

引用

@article{arxiv.2407.04973,
  title  = {LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts},
  author = {Yijia Xiao and Edward Sun and Tianyu Liu and Wei Wang},
  journal= {arXiv preprint arXiv:2407.04973},
  year   = {2024}
}

备注

LogicVista benchmarks the logical reasoning of multimodal large language models in visual tasks