中文

面向儿童数学奥林匹克的大型视觉语言模型评估

机器学习 2024-12-09 v2 人工智能 计算与语言 计算机视觉与模式识别

摘要

近年来,大型视觉语言模型(LVLMs)在通用问题解决能力上取得了显著进展,例如 ChatGPT、Gemini 等;其中一些突破甚至似乎能够使 AI 模型在各种需要更高阶认知技能的任务中超越人类水平。当前的大型 AI 模型是否具备如人类般的泛化问题解决能力?然而,针对 AI 在联合视觉与文本推理方面能力的系统性分析在当前文献中仍缺乏。本文致力于填补这一空白,通过在儿童奥林匹克的数学问题中评估最先进的 LVLMs 的数学与算法推理能力。具体而言,我们考虑来自数学枢纽(Mathematical Kangaroo, MK)奥林匹克的问题,该竞赛是针对 1-12 年级儿童的流行国际竞赛,使用旨在匹配年龄和技能水平的谜题来测试儿童的深层数学能力。借助 MK 的谜题,我们创建了一个名为 SMART-840 的数据集,包含 2020-2024 年的 840 个问题。凭借我们的数据集,我们分析了 LVLMs 在数学推理方面的能力;他们对我们谜题的响应为直接比较儿童的水平提供了方式。我们的结果表明,现代 LVLMs 在解决更高年级问题的推理能力上表现出日益强大的能力,但缺乏正确解答面向年幼儿童问题的基础。进一步的分析显示,AI 模型的推理能力与年幼儿童的推理能力之间不存在显著相关性,其能力似乎基于与儿童数学和逻辑技能所基于的累积知识不同的类型推理。

关键词

引用

@article{arxiv.2406.15736,
  title  = {Evaluating Large Vision-and-Language Models on Children's Mathematical Olympiads},
  author = {Anoop Cherian and Kuan-Chuan Peng and Suhas Lohit and Joanna Matthiesen and Kevin Smith and Joshua B. Tenenbaum},
  journal= {arXiv preprint arXiv:2406.15736},
  year   = {2024}
}

备注

Accepted at NeurIPS 2024 (Datasets and Benchmarks Track)