生成式AI的认知能力:与人类基准的比较分析
人工智能
2024-10-11 v1
摘要
日益增加的关注度正在推动对通用人工智能基础模型能力的跟踪。本研究对顶尖大语言模型和视觉语言模型进行基准测试,评估其在威赫斯利成人智力量表(WAIS-IV)上的表现,该量表是全面、按人群标准化的评估人类认知与智力能力的工具,重点关注口语理解(VCI)、工作记忆(WMI)和感知推理(PRI)三个领域。大多数模型在存储、检索和操作诸如字母和数字等离散符号方面表现卓越,针对工作记忆指数(WMI)的表现在人群标准化能力上达到或超过第99.5百分位。口语理解指数(VCI)衡量的是已获取信息的检索能力以及对词语意义及其相互关系的语言理解能力,其表现也稳定地达到或超过第98百分位。尽管如此,我们观察到从多模态模型中对感知推理指数(PRI;表现范围为0.1-10百分位)的持续表现较差,表明这些模型在解释和推理视觉信息方面存在显著不足。规模较小或更新较旧的模型版本表现更差,这表明训练数据、参数规模以及调优技术的进步正在显著推动认知能力的提升。
引用
@article{arxiv.2410.07391,
title = {The Cognitive Capabilities of Generative AI: A Comparative Analysis with Human Benchmarks},
author = {Isaac R. Galatzer-Levy and David Munday and Jed McGiffin and Xin Liu and Danny Karmon and Ilia Labzovsky and Rivka Moroshko and Amir Zait and Daniel McDuff},
journal= {arXiv preprint arXiv:2410.07391},
year = {2024}
}