LEAF-QA:用于图表问答的定位、编码与注意力机制
计算机视觉与模式识别
2019-07-31 v1
摘要
我们提出 LEAF-QA,一个由真实世界开放数据源构建的包含 个密集标注图形/图表以及约 200 万对查询这些图表结构与语义的问答(QA)对的综合数据集。LEAF-QA 凸显了多模态 QA 的问题,它与传统的视觉 QA(VQA)明显不同,且近期受到学界关注。此外,LEAF-QA 比先前图表 QA 的尝试(即 FigureQA 和 DVQA,其图表数据仅呈现有限变化)显著更复杂。LEAF-QA 构建自真实世界数据源,需要一种新颖架构来实现问答。为此,我们提出 LEAF-Net,一种涉及图表元素定位、基于图表元素的问题与答案编码以及注意力网络的深度架构。我们进行了不同实验以展示 LEAF-QA 上 QA 的挑战性。所提架构 LEAF-Net 也在 FigureQA 和 DVQA 上大幅推进了当前最优水平。
引用
@article{arxiv.1907.12861,
title = {LEAF-QA: Locate, Encode & Attend for Figure Question Answering},
author = {Ritwick Chaudhry and Sumit Shekhar and Utkarsh Gupta and Pranav Maneriker and Prann Bansal and Ajay Joshi},
journal= {arXiv preprint arXiv:1907.12861},
year = {2019}
}