多模态大语言模型中的视觉数学评估:基于康加罗测试的多语言基准
人工智能
2025-06-10 v1
摘要
多模态大语言模型(MLLMs)在视觉语言能力上具有前景,但其在视觉呈现的数学问题上的有效性尚未得到充分探索。本文分析了开发和评估 MLLMs 用于数学问题解决的过程,重点关注图表、多语言文本和符号表示。随后我们评估了包括 GPT-4o、Pixtral、Qwen VL、Llama 3.2 Vision 变体和 Gemini 2.0 Flash 在内的多个模型,构建一个覆盖英语、法语、西班牙语和加泰罗尼亚语的多语言康加罗式基准。我们的实验揭示了四个关键发现。首先,整体准确率在几何、视觉代数、逻辑、图案和组合学方面仍属中等:没有单一模型在所有主题上都表现出色。其次,虽然大多数模型在无图像问题上的准确率有所提高,但提升往往有限;部分题目在无视觉输入时准确率几乎不变,表明对图表信息的利用不足。第三,在语言和难度层次之间存在显著差异:模型经常处理较简单题目,但在高级几何和组合推理方面表现不佳。值得注意的是,Gemini 2.0 Flash 在基于图像的任务中取得最高准确率,其后是 Qwen VL 2.5 72B 和 GPT-4o,尽管 none 接近人类水平。第四,针对区分模型是推理还是仅复述的complementary分析显示,Gemini 和 GPT-4o 在结构化推理和一致准确率方面领先;相比之下,Pixtral 和 Llama 表现较差,往往在无法将输出与给定选项对齐时依赖启发式方法或随机性。
引用
@article{arxiv.2506.07418,
title = {Evaluating Visual Mathematics in Multimodal LLMs: A Multilingual Benchmark Based on the Kangaroo Tests},
author = {Arnau Igualde Sáez and Lamyae Rhomrasi and Yusef Ahsini and Ricardo Vinuesa and Sergio Hoyas and Jose P. García Sabater and Marius J. Fullana i Alfonso and J. Alberto Conejero},
journal= {arXiv preprint arXiv:2506.07418},
year = {2025}
}
备注
16 pages, 4 figures