中文

面向多模态大语言模型的流程图理解的首次多维评估

计算机视觉与模式识别 2024-11-07 v3 人工智能

摘要

随着多模态大语言模型(MLLMs)技术的发展,其通用能力日益强大。为了评估 MLLMs 的各种能力,涌现出众多评估系统。但目前仍缺乏一种综合的方法来评估与流程图相关任务的 MLLMs,这些任务在日常生活和工作中非常重要。我们提出了第一套全面方法 FlowCE,用于评估 MLLMs 在流程图相关任务中的各个维度能力。它涵盖了评估 MLLMs 在流程图上进行推理、局部识别、信息提取、逻辑验证和总结等能力。然而,我们发现即使是 GPT4o 模型也仅获得了 56.63 的分数。在开源模型中,Phi-3-Vision 获得了最高的 49.97 分。我们希望 FlowCE 能为未来基于流程图的 MLLMs 研究贡献力量。\url{https://github.com/360AILABNLP/FlowCE}

关键词

引用

@article{arxiv.2406.10057,
  title  = {First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models},
  author = {Enming Zhang and Ruobing Yao and Huanyong Liu and Junhui Yu and Jiale Wang},
  journal= {arXiv preprint arXiv:2406.10057},
  year   = {2024}
}