MMSci:面向研究生水平的多学科多模态科学理解数据集
计算与语言
2025-02-21 v3 人工智能
计算机视觉与模式识别
摘要
科学图表解释是面向基于先进大型视觉语言模型构建的 AI 科学助手的关键能力。然而,当前的数据集和基准主要聚焦于简单图表或其他相对直观的图形,涵盖的科学学科范围有限。为填补这一差距,我们提供了一个综合性数据集,来源于来自 Nature Communications 的同行评审文章,覆盖 72 个科学领域,包含复杂可视化内容,如示意图、显微图像和实验数据等,这些内容需要专业知识进行解读。我们对 19 个专有和开源模型在两个基准任务(图表描述和多选题)上进行评估,并进行了人类专家标注。我们的分析揭示了显著的任务挑战和模型间的性能差距。除了作为基准之外,该数据集也是大规模训练的宝贵资源。使用我们任务特定的数据对 Qwen2-VL-7B 进行微调,在多个选择题评估中实现了超过 GPT-4o 乃至人类专家的更好性能。此外,对我们交错的文章和图表数据进行持续预训练,显著增强了模型在材料科学等下游任务中的性能。我们已发布该数据集以支持进一步研究。
引用
@article{arxiv.2407.04903,
title = {MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding},
author = {Zekun Li and Xianjun Yang and Kyuri Choi and Wanrong Zhu and Ryan Hsieh and HyeonJung Kim and Jin Hyuk Lim and Sungyoung Ji and Byungju Lee and Xifeng Yan and Linda Ruth Petzold and Stephen D. Wilson and Woosang Lim and William Yang Wang},
journal= {arXiv preprint arXiv:2407.04903},
year = {2025}
}
备注
Code and data are available at https://github.com/Leezekun/MMSci