中文

ScratchEval:GPT-4o 是否比我的孩子更聪明?基于视觉编程挑战评估大型多模态模型

计算与语言 2024-12-02 v1 人工智能 计算机视觉与模式识别

摘要

近期大型多模态模型(LMM)的快速发展展现出惊人的代码生成能力,主要通过图像到代码基准测试进行评估。然而,这些基准测试仅限于特定的视觉编程场景,其中逻辑推理与多模态理解能力被分割开来。为填补这一空白,我们提出了 ScratchEval,一种新颖的基准测试,旨在评估大型多模态模型的视觉编程推理能力。ScratchEval 基于 Scratch——一种广泛用于儿童编程教育的块状视觉编程语言。通过集成视觉元素与嵌入式编程逻辑,ScratchEval 需要模型同时处理视觉信息和代码结构,从而全面评估其编程意图理解能力。我们的评估方法超越传统的图像到代码映射,聚焦于统一的逻辑思维和问题解决能力,为评估大型多模态模型的视觉编程能力提供更全面和更具挑战性的框架。ScratchEval 不仅填补了现有评估方法的空白,也为大型多模态模型在视觉编程领域的未来发展提供了新见解。本基准测试可在 https://github.com/HKBUNLP/ScratchEval 查阅。

关键词

引用

@article{arxiv.2411.18932,
  title  = {ScratchEval: Are GPT-4o Smarter than My Child? Evaluating Large Multimodal Models with Visual Programming Challenges},
  author = {Rao Fu and Ziyang Luo and Hongzhan Lin and Zhen Ye and Jing Ma},
  journal= {arXiv preprint arXiv:2411.18932},
  year   = {2024}
}