SPIQA: 面向科学论文的多模态图像问答数据集
计算与语言
2025-01-14 v3 人工智能
计算机视觉与模式识别
摘要
在长篇科学研究文章中寻求答案是关键研究领域,有助于读者快速解决疑问。然而,现有基于科学论文的问答数据集规模有限且仅关注文本内容。我们介绍 SPIQA (Scientific Paper Image Question Answering),首个专为解读科学研究文章中复杂图表而设计的大规模问答数据集,覆盖计算机科学等多个领域。依托多模态大语言模型 (MLLM) 的广泛专业知识和图像理解能力,我们采用自动化和人工方式构建数据集。我们构建了基于交错图像和文本的信息寻求任务,涉及多个覆盖图表、图表、示意图和结果可视化的图像。SPIQA 包含 27 万个问题,划分为训练、验证和三个不同评估划分。通过对 12 个主流基础模型进行大规模实验,我们评估了当前多模态系统理解科学文章细微方面的能力。此外,我们提出一种基于 hallucination 检测的链式思维 (CoT) 评估策略,允许进行细粒度、逐步评估并提升模型性能。我们进一步探索了通过增加文本信息获取性能提升的上限,凸显其在未来研究中的广阔潜力以及该数据集对革新我们与科学文献互动方式的影响。
引用
@article{arxiv.2407.09413,
title = {SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers},
author = {Shraman Pramanick and Rama Chellappa and Subhashini Venugopalan},
journal= {arXiv preprint arXiv:2407.09413},
year = {2025}
}
备注
NeurIPS 2024, Datasets & Benchmarks track