生成式 AI 模型各代际间认知的不均衡演化
人工智能
2026-05-11 v1 计算机视觉与模式识别
摘要
对通用人工智能的追求需要稳健的方法来评估模型超越狭窄任务表现的认知能力。在此,我们引入了一个心理测量框架来评估生成式 AI 的认知特征,将其与人类常模进行比较,并追踪其在各代际间的演化。使用改编自韦氏成人智力量表的任务对领先的多模态模型进行的初步评估揭示了一种极不均衡的认知架构:言语理解和工作记忆接近上限的表现(> 百分位)与知觉推理接近下限的表现(< 百分位)形成了鲜明对比。为了追踪超越人类常模极限的发展轨迹,我们开发了人工智能商数 (AIQ) 基准,并将其应用于六个代际和两个模型家族,揭示了显著但不均衡的性能提升。值得注意的是,我们发现了不同模态之间的急剧分离;当以语言形式呈现时,抽象定量推理的成熟速度远快于视觉类比形式,这表明存在一种基于语言的符号操作架构偏向。尽管抽象视觉推理有所改善,但视觉知觉组织在很大程度上停滞不前。总体而言,这些发现表明生成式模型的认知能力正在不均衡地演化,这意味着仅靠扩展和优化方法来发展通用人工智能,可能不足以克服实现均衡、类人通用智能的根本架构限制。
引用
@article{arxiv.2605.06815,
title = {Uneven Evolution of Cognition Across Generations of Generative AI Models},
author = {Isaac Galatzer-Levy and Daniel McDuff and Xin Liu and Jed McGiffin},
journal= {arXiv preprint arXiv:2605.06815},
year = {2026}
}
备注
25 pages, 5 Figures, 3 Tables