人工智能认知考试:多模态评估从识别到推理的演进综述
人工智能
2026-01-07 v2
摘要
本综述论文记录了人工智能(AI)多模态评估的演进,将其界定为日益精细化的"认知考试"。我们认为该领域正经历范式转变,从测试模型看到什么的简单识别任务,迁移到探究模型为何以及如何理解的复杂推理基准。这种演进由评估基准的饱和所驱动,高性能往往掩盖了根本性弱点。我们描绘了从ImageNet时代基础"知识测试"到旨在诊断系统性缺陷(如shortcut学习和组合泛化失败)的"应用逻辑与理解"考试(如GQA和Visual Commonsense Reasoning (VCR))的旅程。随后我们综述当前面向强大多模态大语言模型(MLLM)的"专家水平集成"基准(如MMBench、SEED-Bench、MMMU),这些基准日益评估推理过程本身。最后,我们探讨了评估抽象、创造性和社交智能的未知领域。我们得出结论,AI评估的叙事不仅是数据集的历史,更是设计更佳考试以重新定义创造真正智能系统目标的持续、对抗性过程。
引用
@article{arxiv.2510.04141,
title = {The Artificial Intelligence Cognitive Examination: A Survey on the Evolution of Multimodal Evaluation from Recognition to Reasoning},
author = {Mayank Ravishankara and Varindra V. Persad Maharaj},
journal= {arXiv preprint arXiv:2510.04141},
year = {2026}
}