面向科学理解的多模态大语言模型 Live 基准:MAC
计算与语言
2025-08-25 v1 人工智能
摘要
随着多模态大语言模型(MLLM)能力的不断提升,固定基准测试逐渐失去评估高层次科学理解的效果。本文引入 Multimodal Academic Cover 基准(MAC),一个能够随科学进步和模型进步持续演化的 live 基准。MAC 利用来自《Nature》《Science》《Cell》等顶级科学期刊的 25,000 多张图片-文本对,挑战 MLLM 在抽象视觉与文本科学内容上的推理能力。在我们最新年度快照 MAC-2025 的实验中,结果显示尽管 MLLM 表现出强大的感知能力,但其跨模态科学推理仍有限。为弥合这一差距,我们提出 DAD 方法,一种轻量级推理时方法,通过扩展 MLLM 视觉特征与语言空间推理,实现最高 11% 的性能提升。最后,我们通过更新期刊封面和模型进行 curation 实验,展示了 MAC 的 live 特性,凸显其与人类知识前沿保持一致的潜力。我们将在 https://github.com/mhjiang0408/MAC_Bench 发布本基准。
引用
@article{arxiv.2508.15802,
title = {MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding},
author = {Mohan Jiang and Jin Gao and Jiahao Zhan and Dequan Wang},
journal= {arXiv preprint arXiv:2508.15802},
year = {2025}
}