Tangram:评估大型多模态模型中几何元素识别的基准
计算机视觉与模式识别
2024-12-18 v2 人工智能
摘要
大型多模态模型(Large Multimodal Models, LMMs)在处理涉及视觉-数学推理的复杂问题方面取得了显著进展,但其识别几何元素的能力尚未得到充分探索。为填补这一空白,我们引入Tangram——一个新颖的基准,用于评估LMMs在几何元素识别任务上的性能。Tangram包含1,080个来自小学和中学考试、竞赛及教科书中来源的多样化几何图示, ranging 从简单几何形状到复杂组合。每个图示配有四个问题,形成4,320个视觉-问题-答案对。不同于强调高级认知与推理的现有基准,Tangram聚焦于几何元素的理解,要求模型执行“简单而具有挑战性”的计数任务。对13个主流LMMs(如GPT-4o和Claude 3.5 Sonnet)的系统评估显示,这些模型即便在看似简单的任务中也面临重大挑战。最佳模型仅达到53.0%的准确率,凸显了当前多模态AI系统在基础感知任务中的显著不足,为开发下一代专家级多模态基础模型指明了方向。该数据集和代码将很快公开。
引用
@article{arxiv.2408.13854,
title = {Tangram: Benchmark for Evaluating Geometric Element Recognition in Large Multimodal Models},
author = {Chao Zhang and Jiamin Tang and Jing Xiao},
journal= {arXiv preprint arXiv:2408.13854},
year = {2024}
}
备注
12 pages, 8 figures