多模态语言模型的核心知识缺陷
计算与语言
2025-06-23 v4 人工智能
计算机视觉与模式识别
摘要
尽管多模态大语言模型(MLLMs)在高层感知和推理方面表现出色,但其在野外的鲁健性仍有限,常常在对人类而言直观且轻松的任务上表现不足。我们检验了这些缺陷源于缺乏核心知识——源自人类幼年时期的先天认知能力——的假设。为探索MLLMs中的核心知识表示,我们引入了CoreCognition,一个涵盖12个核心知识概念的大规模基准,这些概念植根于发展心理学。我们评估了230个模型,采用11种不同的提示方式,形成2530个数据点进行分析。我们的实验发现,四项关键发现共同展示了MLLMs的核心知识缺陷:它们在低层次能力上持续表现不足,且显示出减少或甚至缺失的可扩展性,而高层次能力表现更好。最后,我们提出了概念黑客(Concept Hacking),这是一种新颖的受控评估方法,揭示了MLLMs未能向真正的核心知识理解迈进,而是随着规模增长而依赖捷径学习。
引用
@article{arxiv.2410.10855,
title = {Core Knowledge Deficits in Multi-Modal Language Models},
author = {Yijiang Li and Qingying Gao and Tianwei Zhao and Bingyang Wang and Haoran Sun and Haiyun Lyu and Robert D. Hawkins and Nuno Vasconcelos and Tal Golan and Dezhi Luo and Hokin Deng},
journal= {arXiv preprint arXiv:2410.10855},
year = {2025}
}
备注
Accepted by ICML 2025. Project page at https://williamium3000.github.io/core-knowledge and code is available at https://github.com/williamium3000/core-knowledge