中文

LEAF-QA:用于图表问答的定位、编码与注意力机制

计算机视觉与模式识别 2019-07-31 v1

摘要

我们提出 LEAF-QA,一个由真实世界开放数据源构建的包含 250,000250,000 个密集标注图形/图表以及约 200 万对查询这些图表结构与语义的问答(QA)对的综合数据集。LEAF-QA 凸显了多模态 QA 的问题,它与传统的视觉 QA(VQA)明显不同,且近期受到学界关注。此外,LEAF-QA 比先前图表 QA 的尝试(即 FigureQA 和 DVQA,其图表数据仅呈现有限变化)显著更复杂。LEAF-QA 构建自真实世界数据源,需要一种新颖架构来实现问答。为此,我们提出 LEAF-Net,一种涉及图表元素定位、基于图表元素的问题与答案编码以及注意力网络的深度架构。我们进行了不同实验以展示 LEAF-QA 上 QA 的挑战性。所提架构 LEAF-Net 也在 FigureQA 和 DVQA 上大幅推进了当前最优水平。

关键词

引用

@article{arxiv.1907.12861,
  title  = {LEAF-QA: Locate, Encode & Attend for Figure Question Answering},
  author = {Ritwick Chaudhry and Sumit Shekhar and Utkarsh Gupta and Pranav Maneriker and Prann Bansal and Ajay Joshi},
  journal= {arXiv preprint arXiv:1907.12861},
  year   = {2019}
}