中文

多模态基础模型能否理解示意图?——基于科学论文的信息检索问答实证研究

计算与语言 2025-07-16 v1 计算机视觉与模式识别

摘要

本文提出了 MISS-QA,首个专门用于评估模型在科学文献中解读示意图能力的基准。MISS-QA 包含 465 篇科学论文上的 1,500 个专家标注样本。在该基准中,模型需要解读展示研究概览的示意图,并根据论文的更广泛上下文回答相应的信息检索问题。我们评估了 18 个前沿多模态基础模型的性能,包括 o4-mini、Gemini-2.5-Flash 和 Qwen2.5-VL。我们揭示了这些模型与人类专家在 MISS-QA 上存在显著的性能差距。我们对模型在不可回答问题上的表现以及详细的错误分析进一步突出了当前模型的优势与局限,为提升模型理解多模态科学文献的能力提供了关键洞见。

关键词

引用

@article{arxiv.2507.10787,
  title  = {Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers},
  author = {Yilun Zhao and Chengye Wang and Chuhan Li and Arman Cohan},
  journal= {arXiv preprint arXiv:2507.10787},
  year   = {2025}
}

备注

ACL 2025 Findings