M3GIA:基于认知心理学的多语言多模态通用智能能力基准
人工智能
2024-06-17 v2 计算与语言
摘要
近期多模态大语言模型(MLLM)在各种复杂任务中展现出强大的能力,引发了人们是否最终能够模拟人类智力的讨论。然而,现有基准主要关注评估任务性能,如对象属性识别准确率。将认知科学融入理解MLLM智力超越表面成就的研究仍有限。为此,我们引入了首个基于认知驱动的多语言多模态基准,用于评估MLLM的通用智能能力,称为M3GIA。具体而言,我们基于广为人知的卡特尔-霍尔-卡罗尔(CHC)智力模型识别出五个关键认知因素,并提出了一种新颖的评估指标。此外,由于大多数MLLM在不同语言中进行训练,一个自然的问题是:语言是否是影响MLLM认知能力的关键因素?因此,我们超越英文,涵盖中文、法语、西班牙语、葡萄牙语和韩语等流行语言,以构建M3GIA。我们确保与文化背景相关的数据均来自其本土语境,以避免以英语为中心的偏见。我们收集了大量来自人类参与者的数据,结果显示最先进的MLLM在英文中仅达到人类智力的下限。然而,在评估的其他五种语言中仍存在显著差距。我们还发现了与认知研究发现一致的“赢家通吃”现象。我们的基准将开放源码,旨在促进MLLM认知能力的提升。
引用
@article{arxiv.2406.05343,
title = {M3GIA: A Cognition Inspired Multilingual and Multimodal General Intelligence Ability Benchmark},
author = {Wei Song and Yadong Li and Jianhua Xu and Guowei Wu and Lingfeng Ming and Kexin Yi and Weihua Luo and Houyi Li and Yi Du and Fangda Guo and Kaicheng Yu},
journal= {arXiv preprint arXiv:2406.05343},
year = {2024}
}