SciGraphQA:一个面向科学图表的大规模合成多轮问答数据集
计算与语言
2023-08-08 v1 人工智能
计算机视觉与模式识别
摘要
在本工作中,我们提出 SciGraphQA,一个与学术图表相关的合成多轮问答数据集。SciGraphQA 的规模是此前最大的图表视觉问答数据集 ChartVQA 的 13 倍,也是最大的使用非合成图表的开放源代码图表 VQA 数据集。为构建我们的数据集,我们筛选了 2010 至 2020 年间发表的 290,000 篇计算机科学或机器学习 arXiv 论文,随后使用 Palm-2 生成了 295K 条关于图表的开放词汇多轮问答对话样本。作为上下文,我们向仅文本的 Palm-2 提供了论文标题、摘要、提及图表的段落以及来自图表本身的富文本上下文数据,获得了每幅图表平均 2.23 个问答轮次的对话。我们请 GPT-4 在给定论文上下文的情况下评估我们问答轮次的匹配质量,在 3K 测试集上获得了 8.7/10 的平均评分。我们评估了最流行的 MLLM 模型(如 LLaVa、mPLUGowl、BLIP-2 和 openFlamingo)在我们数据集上的零样本能力,发现 LLaVA-13B 表现最佳,CIDEr 得分为 0.08。我们通过使用 DePlot 模型从图表中提取的序列化数据表来丰富 LLAVA 的问题提示,将其零样本 CIDEr 提升至 0.15。为验证我们数据集的有效性,我们还使用我们的数据集对 LLaVa 进行了微调,达到了 0.26 的显著更高的 CIDEr 得分。我们预期通过引入分割掩码令牌并利用更大的 LLM 主干网络与涌现提示技术可进一步提高准确率。我们的代码与数据已开源。
引用
@article{arxiv.2308.03349,
title = {SciGraphQA: A Large-Scale Synthetic Multi-Turn Question-Answering Dataset for Scientific Graphs},
author = {Shengzhi Li and Nima Tajbakhsh},
journal= {arXiv preprint arXiv:2308.03349},
year = {2023}
}