科学家首次考试:通过感知、理解与推理探测多模态大语言模型的认知能力
人工智能
2025-11-17 v6 计算与语言
摘要
科学发现日益依赖于基于信息密集型科学数据和领域专业知识的复杂多模态推理。在专家级科学基准的支撑下,科学多模态大语言模型(Multimodal Large Language Models, MLLMs)有潜力在真实工作流中显著增强这一发现过程。然而,当前的科学基准大多侧重于评估MLLM的知识理解能力,导致对其感知和推理能力的评估不足。为填补这一空白,我们提出了科学家首次考试(Scientists' First Exam, SFE)基准,旨在通过三个相互关联的层次——科学信号感知、科学属性理解、科学比较推理——评估MLLM的科学认知能力。具体而言,SFE包含830个专家验证的VQA对,涵盖三种问题类型,横跨五个高价值学科的66个多模态任务。大量实验表明,当前最先进的GPT-o3和InternVL-3在SFE上仅取得34.08%和26.52%的成绩,凸显了MLLM在科学领域仍有显著提升空间。我们希望SFE中获得的见解将促进AI增强科学发现的进一步发展。
引用
@article{arxiv.2506.10521,
title = {Scientists' First Exam: Probing Cognitive Abilities of MLLM via Perception, Understanding, and Reasoning},
author = {Yuhao Zhou and Yiheng Wang and Xuming He and Ao Shen and Ruoyao Xiao and Zhiwei Li and Qiantai Feng and Zijie Guo and Yuejin Yang and Hao Wu and Wenxuan Huang and Jiaqi Wei and Dan Si and Xiuqi Yao and Jia Bu and Haiwen Huang and Manning Wang and Tianfan Fu and Shixiang Tang and Ben Fei and Dongzhan Zhou and Fenghua Ling and Yan Lu and Siqi Sun and Chenhui Li and Guanjie Zheng and Jiancheng Lv and Wenlong Zhang and Lei Bai},
journal= {arXiv preprint arXiv:2506.10521},
year = {2025}
}
备注
82 pages