PlotQA:面向科学图表推理
计算机视觉与模式识别
2020-02-04 v3 人工智能
计算与语言
摘要
现有的用于图表推理的合成数据集(FigureQA、DVQA)不包含数据标签的多样性、实值数据或复杂推理问题。因此,针对这些数据集提出的模型未能充分应对图表推理的挑战。具体而言,它们假定答案要么来自一个小型固定词表,要么来自图像中的边界框。然而在实践中,这是一个不切实际的假设,因为许多问题需要推理,从而具有既不在小型固定词表中也不在图像中出现的实值答案。在本工作中,我们旨在弥合现有数据集与真实世界图表之间的差距。具体地,我们提出 PlotQA,其包含基于真实世界数据源的 224,377 幅图表上的 28.9 百万问答对,以及基于众包问题模板的问题。此外,PlotQA 中 80.76% 的集外(OOV)问题的答案不在固定词表中。对现有模型在 PlotQA 上的分析表明,它们无法处理 OOV 问题:其在我们数据集上的总体准确率仅为个位数。鉴于这些模型并非为此类问题而设计,这并不令人意外。作为迈向能同时处理固定词表与 OOV 问题的更整体模型的一步,我们提出一种混合方法:特定问题通过从固定词表中选择答案或从预测的图表边界框中提取答案来回答,而其他问题则由表问答引擎回答,该引擎以从图像中检测视觉元素所生成的结构化表格为输入。在现有 DVQA 数据集上,我们的模型准确率为 58%,显著优于已报告的最高准确率 46%。在 PlotQA 上,我们的模型准确率为 22.52%,显著优于当前最先进模型。
引用
@article{arxiv.1909.00997,
title = {PlotQA: Reasoning over Scientific Plots},
author = {Nitesh Methani and Pritha Ganguly and Mitesh M. Khapra and Pratyush Kumar},
journal= {arXiv preprint arXiv:1909.00997},
year = {2020}
}
备注
This is an extension of our previous arxiv paper "Data Interpretation over Plots" and it is to be presented at WACV 2020