看到森林和树木:使用大型多模态模型解决图形和树状数据结构问题
人工智能
2024-12-17 v1 计算机视觉与模式识别
计算机与社会
摘要
近期生成式AI系统的进展引发了教育界对学术诚信的担忧。除了在解决编程问题和基于文本的选择题方面表现出色,近期的研究还发现,大型多模态模型(LMM)仅凭图像就能解决Parsons问题。然而,这类问题本质上是基于文本的,依赖模型将图像中的代码块转换为相应文本的能力。在本文中,我们进一步调查LMM解决仅基于图像的图形和树状数据结构问题的能力。为此,我们计算构建并评估了一个包含9,072个样本的新型基准数据集,以评估GPT-4o、GPT-4v、Gemini 1.5 Pro、Gemini 1.5 Flash、Gemini 1.0 Pro Vision和Claude 3模型系列的性能。GPT-4o在树状样本上取得了87.6%的准确率,而Gemini 1.5 Flash在图形样本上取得了56.2%的准确率。我们的发现突显了结构和视觉变异对模型性能的影响。该研究不仅引入了一个LMM基准,便于复制和进一步探索,也强调了LMM在解决复杂计算问题方面的潜力,这对教学实践和评估方式具有重要意义。
引用
@article{arxiv.2412.11088,
title = {Seeing the Forest and the Trees: Solving Visual Graph and Tree Based Data Structure Problems using Large Multimodal Models},
author = {Sebastian Gutierrez and Irene Hou and Jihye Lee and Kenneth Angelikas and Owen Man and Sophia Mettille and James Prather and Paul Denny and Stephen MacNeil},
journal= {arXiv preprint arXiv:2412.11088},
year = {2024}
}
备注
14 pages, 4 figures, to be published in ACE 2025