中文

Multimodal ArXiv:一个用于提升大型视觉 - 语言模型科学理解能力的数据集

计算机视觉与模式识别 2024-06-04 v3 计算与语言

摘要

大型视觉 - 语言模型(LVLMs)在涉及自然场景具体图像的多样化任务中表现出色。然而,由于科学领域训练数据集的稀缺,它们解释抽象图形(如几何形状和科学图表)的能力仍然有限。为填补这一空白,我们推出了 Multimodal ArXiv,包含 ArXivCap 和 ArXivQA,旨在增强 LVLMs 的科学理解能力。ArXivCap 是一个图 - 文描述数据集,包含 640 万张图像和 390 万条描述,源自跨越各个科学领域的 57.2 万篇 ArXiv 论文。基于 ArXivCap,我们引入了 ArXivQA,这是一个通过提示 GPT-4V 基于科学图形生成的问答数据集。ArXivQA 极大地增强了开源 LVLMs 的数学推理能力,在多模态数学推理基准测试中实现了 10.4% 的绝对准确率提升。此外,利用 ArXivCap,我们设计了四个视觉到文本任务用于基准测试 LVLMs。对最先进 LVLMs 的评估结果突显了它们在处理学术图形细微语义方面的困难,而特定领域的训练则带来了显著的性能提升。我们的误差分析揭示了当前 LVLMs 存在视觉语境误解、识别错误以及生成过于简化描述的问题,为未来的改进指明了方向。

关键词

引用

@article{arxiv.2403.00231,
  title  = {Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models},
  author = {Lei Li and Yuqi Wang and Runxin Xu and Peiyi Wang and Xiachong Feng and Lingpeng Kong and Qi Liu},
  journal= {arXiv preprint arXiv:2403.00231},
  year   = {2024}
}

备注

Project page: https://mm-arxiv.github.io, Camera Ready Version of ACL 2024