VisScience:用于评估K12教育多模态科学推理的全面基准
人工智能
2024-12-03 v2 计算与语言
摘要
多模态大语言模型(MLLM)通过整合文本和视觉信息在各种任务中展现出有前景的能力,实现复杂情景下的视觉理解。尽管已有多个基准旨在评估MLLM在视觉问答到复杂问题解决等任务方面的表现,但大多数基准主要关注数学或通用视觉理解任务。这暴露了当前基准的一个关键缺口,即往往忽视其他关键科学学科,如物理学和化学的纳入。为此,我们细致构建了一个全面的基准,称为VisScience,用于评估跨数学、物理和化学三个学科的多模态科学推理。该基准包含3000个问题来自K12教育——从小学到高中均涵盖——在三个学科中均匀分布,每门学科1000个问题。VisScience中的问题涵盖21个不同学科,并按五个难度级别分类,为每个学科提供了广泛的主题范围。通过VisScience,我们对25个代表性MLLM在科学推理中的表现进行了详细评估。实验结果表明,封闭源MLLM通常优于开源模型。最佳表现包括Claude3.5-Sonnet在数学中达到53.4%准确率、GPT-4o在物理中达到38.2%准确率、Gemini-1.5-Pro在化学中达到47.0%准确率。这些结果凸显了MLLM的优势与局限,为未来的改进指明了方向,突显了开发能够有效处理多模态科学推理多样化需求的模型的重要性。
引用
@article{arxiv.2409.13730,
title = {VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning},
author = {Zhihuan Jiang and Zhen Yang and Jinhao Chen and Zhengxiao Du and Weihan Wang and Bin Xu and Jie Tang},
journal= {arXiv preprint arXiv:2409.13730},
year = {2024}
}
备注
89 pages, 70 figures