中文

儿童智力测试对 MLLMs 构成挑战?KidGym:面向 MLLMs 的 2D 网格推理基准

计算与语言 2026-04-02 v3 人工智能

摘要

多模态大型语言模型(MLLMs)将 LLMs 的语言能力与处理多模态数据的能力相结合,使其能够解决更广泛的视觉任务。由于 MLLMs 旨在实现比语言模型更广泛、类人水平的能力,我们借鉴了 Wechsler 智力量表——这一用于评估儿童的成熟电池,通过分解智力为可解释、可测试的能力——我们引入 KidGym,这是一个面向评估 MLLMs 五项核心能力的 2D 网格基准:执行、感知推理、学习、记忆和规划。该基准包含 12 个独特任务,每个任务至少针对一个核心能力,旨在衡量 MLLMs 的可适应性和发展潜力,映射儿童认知发展的阶段。此外,我们的任务涵盖多样场景和对象,采用随机生成的布局,确保对 MLLM 能力进行更准确、更稳健的评估。KidGym 旨在完全可定制和可扩展,允许研究人员创建新的评估情景并调整难度水平以适应快速增长的 MLLM 社区。通过使用 KidGym 评估最先进的 MLLMs,我们识别出了关于模型能力的重要见解,并揭示了当前模型的若干局限。我们在以下地址发布了本基准:https://bobo-ye.github.io/KidGym/。

关键词

引用

@article{arxiv.2603.20209,
  title  = {Children's Intelligence Tests Pose Challenges for MLLMs? KidGym: A 2D Grid-Based Reasoning Benchmark for MLLMs},
  author = {Hengwei Ye and Yuanting Guan and Yuxuan Ge and Tianying Zhu and Zhenhan Guan and Yijia Zhong and Yijing Zhang and Han Zhang and Yingna Wu and Zheng Tian},
  journal= {arXiv preprint arXiv:2603.20209},
  year   = {2026}
}

备注

Accepted at ICLR 2026