KiVA:基于儿童视角的视觉类比测试大型多模态模型
计算机视觉与模式识别
2025-12-05 v3 人工智能
计算与语言
机器学习
摘要
本文探讨了大型多模态模型(LMM)在视觉类比推理方面的表现,与成年人和儿童进行比较。所谓"视觉类比",是指从一张图像中推断抽象规则并应用于另一张图像。虽然已有基准测试用于检验 LMM 的视觉推理能力,但这些测试要求较高的技能,且遗漏了即使是幼儿也能完成的基础视觉类比。我们受发展心理学启发,提出构建一个包含 4,300 个日常物体视觉变换的新基准,以测试 LMM 在视觉类比推理方面的能力,并将其与 3 至 5 岁儿童和成年人进行比较。我们将评估分为三个阶段:识别发生了什么变化(例如颜色、数量等),识别变化的方式(例如增加了一个物体),以及将该规则应用于新情境。我们的发现表明,尽管 GPT-o1、GPT-4V、LLaVA-1.5 和 MANTIS 能够有效识别"是什么",但在量化"方式"和将该规则外推到新物体方面仍存在挑战。相比之下,儿童和成年人在所有三个阶段都展现出更强的类比推理能力。此外,最强的测试模型 GPT-o1 在涉及简单表层视觉属性(如颜色和大小)的任务中表现更好,与人类成年人反应速度更快相关。相反,涉及数量、旋转和反射等更复杂任务的挑战更大,这些任务需要大量的认知处理和对物理世界中外在空间属性的理解。总体而言,这些发现凸显了主要基于 2D 图像和文本数据训练的模型存在的局限性。
引用
@article{arxiv.2407.17773,
title = {KiVA: Kid-inspired Visual Analogies for Testing Large Multimodal Models},
author = {Eunice Yiu and Maan Qraitem and Anisa Noor Majhi and Charlie Wong and Yutong Bai and Shiry Ginosar and Alison Gopnik and Kate Saenko},
journal= {arXiv preprint arXiv:2407.17773},
year = {2025}
}
备注
10 pages. Project website: https://ey242.github.io/kiva.github.io/. Benchmark and code: https://github.com/ey242/KiVA