中文

M3Kang: 评估视觉语言模型中的多语言多模态数学推理

计算与语言 2026-01-26 v1 人工智能

摘要

尽管最先进的视觉语言模型已展现出强大的推理能力,但其在多语言数学推理方面的表现,尤其是与人类表现相比,仍未得到充分探索。为弥补这一差距,我们引入了M3Kang,这是首个面向视觉语言模型的大规模多语言、多模态数学推理数据集。它源自袋鼠数学竞赛,这是世界上规模最大的数学竞赛,每年吸引来自90多个国家、超过600万名18岁以下参赛者。M3Kang包含1,747道按年级难度组织的独特选择题,并配有108种文化多样语言的翻译,其中部分题目包含解题所必需的图表。利用该数据集,我们对闭源和开源的最先进模型进行了广泛的基准测试。我们观察到,尽管近期取得了进展,模型在基础数学和基于图表的推理方面仍然存在困难,其性能随语言存在度和模型规模提升,但不随年级水平提升。我们还发现,多语言技术可以有效地扩展到多模态场景,从而在基线方法基础上带来显著改进。我们的分析还包含了来自超过68,000名学生的表现数据,从而能够与人类表现进行直接比较。我们将开源M3Kang,包括仅英文的子集M2Kang,以及用于构建该数据集的框架和代码库。

关键词

引用

@article{arxiv.2601.16218,
  title  = {M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models},
  author = {Aleix Torres-Camps and Nathaniel Mitrani Hadida and Víctor Conchello Vendrell and Àlex Batlle Casellas and Arnau Padrés Masdemont and Jordi Ros-Giralt},
  journal= {arXiv preprint arXiv:2601.16218},
  year   = {2026}
}

备注

10 pages, 8 figures